Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Prime Intellect稱內部推論系統日處理近1兆個Token,首度對外開放服務

負責推論運算的GPU加速器與連接線 / TokenPost.ai

Prime Intellect表示,旗下內部推論系統每天處理近1兆個Token。公司現將系統對外開放,並推出首款模型GLM-5.3。

BlockBeats於未提供日期的報導指出,Prime Inference過去用於強化學習、合成資料生成、模型評估與程式編寫代理任務。使用者可按需求呼叫模型推論,也可預先保留容量,以便長時間穩定使用;API與OpenAI API相容。

Prime Intellect在既有的強化學習、評估及沙盒訓練基礎設施上加入推論服務,讓模型訓練與實際部署能在同一平台進行,並將服務運作期間產生的資料用於後續訓練。BlockBeats另指出,公司自今年1月起也為客戶營運大規模部署服務。

為因應長篇輸入與代理任務,Prime Intellect將輸入處理和回答生成分配給不同的GPU群組。公司自行測試顯示,Token間延遲的p90值較原先降低約40%;p90代表90%的測量值不高於該數值。

公司表示,壓縮KV快取後,單一解碼器在相同記憶體中可保留的Token數量,從109萬個增加至163萬個,增幅約50%。延遲與快取容量數據均為公司自行測試結果。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1