Chutes與哈佛研究團隊公開一份包含61億2241萬3756筆大型語言模型(LLM)請求的資料集。資料未披露實際對話內容,而是公開服務元資料,供研究人員分析生成式AI基礎設施的快取與路由架構。
研究論文《A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing》分析了2025年4月11日至2026年4月12日期間,在Chutes產生的請求。資料包含9174個模型,以及31萬4970名匿名使用者的請求紀錄。
公開儲存庫收錄請求時間、模型、使用者與服務執行個體識別碼、輸入與輸出Token數、首Token生成時間(TTFT),以及快取Token數。資料集以Parquet格式發布於公開儲存庫。
完整檔案大小約91GB,每一列代表一筆API呼叫。使用者識別碼每3個月重新匿名化,提示詞與模型實際回應則未列入公開內容。
研究團隊特別關注重複請求的時間集中現象。同一使用者向同一模型再次發送的請求中,99%是在前一次請求後15分鐘內發生。
若同一使用者在短時間內連續發送請求,便能提高前綴快取(prefix cache)的效益。前綴快取會儲存已處理的輸入,以減少預填充(prefill)運算並縮短首Token生成時間。
快取效率與負載平衡並不一定朝同一方向發展。將相關請求送往同一個GPU執行個體,可以提高快取重用率,但也可能造成特定執行個體負載集中;分散到多個執行個體則能平均分配負載,卻可能讓相同的快取狀態在多處複製。
研究團隊提出,具快取感知能力的路由雖能提高Token命中率,但必須承受一定程度的負載不均。路由是決定請求應送往哪個模型與服務執行個體的程序,需同時考量快取重用與GPU資源分配。
資料也顯示,LLM的使用型態可能正在改變。資料期間的輸入長度大致穩定,但輸出長度中位數從數百個Token降至100個Token以下。
研究團隊表示,這可能反映短篇且重複性的自動請求增加,使用者不再以往返較長回覆的對話型使用為主。不過,僅憑紀錄無法完全區分各請求來自人類還是軟體。
不同模型的使用占比也並非固定不變。初期由DeepSeek系列模型主導流量,之後使用比重轉向Qwen3-32B與DeepSeek-V3.2等模型,非主流模型的流量占比也有所增加。
研究團隊指出,僅憑特定時間點的觀測,難以推估長期GPU容量或模型需求。換言之,單一平台觀察到的使用量變化,不能直接等同於整體LLM服務市場的需求變化。
這份資料集的另一項意義,在於Chutes是在Bittensor子網路64上運作的分散式AI推論基礎設施。分散式推論平台會將請求分配至多個執行個體處理,而此次資料則以實際運作環境累積的請求流量作為研究對象。
不過,資料僅來自單一分散式推論平台,因此不能直接代表整體LLM市場或台灣AI服務的使用型態。此次資料集公開對Bittensor的TAO價格或代幣需求造成的直接影響,也尚未獲得確認。
此次資料的應用範圍主要集中在AI模型運營效率與基礎設施設計研究。研究核心在於,利用實際請求紀錄分析快取重用率與GPU負載分配之間的關係。
研究團隊公開的資料可用於同步分析請求模式、模型使用變化與服務延遲時間。由於資料排除了提示詞與回應,研究重點並非使用者對話本身,而是LLM服務的運作方式與基礎設施資源分配。
常見問題
Q. 這份資料集包含實際使用者對話內容嗎?
不包含。資料未收錄提示詞與模型回應,僅公開請求時間、Token數、延遲時間及快取相關資訊等服務元資料。
Q. 99%代表什麼?
研究結果顯示,在同一使用者向同一模型重複發送請求的情況下,其中99%是在前一次請求後15分鐘內發生。
Q. 這與Bittensor有直接關係嗎?
Chutes是在Bittensor子網路64上運作的推論平台。不過,此次資料集公開對TAO價格或代幣需求造成的直接影響尚未獲得確認。
留言 0