Prime Intellect表示,旗下內部推論系統每天處理近1兆個Token。公司現將系統對外開放,並推出首款模型GLM-5.3。
BlockBeats於未提供日期的報導指出,Prime Inference過去用於強化學習、合成資料生成、模型評估與程式編寫代理任務。使用者可按需求呼叫模型推論,也可預先保留容量,以便長時間穩定使用;API與OpenAI API相容。
Prime Intellect在既有的強化學習、評估及沙盒訓練基礎設施上加入推論服務,讓模型訓練與實際部署能在同一平台進行,並將服務運作期間產生的資料用於後續訓練。BlockBeats另指出,公司自今年1月起也為客戶營運大規模部署服務。
為因應長篇輸入與代理任務,Prime Intellect將輸入處理和回答生成分配給不同的GPU群組。公司自行測試顯示,Token間延遲的p90值較原先降低約40%;p90代表90%的測量值不高於該數值。
公司表示,壓縮KV快取後,單一解碼器在相同記憶體中可保留的Token數量,從109萬個增加至163萬個,增幅約50%。延遲與快取容量數據均為公司自行測試結果。
留言 0