Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

GLM-5.3-FlashX發布:最高推理速度達200 tokens/s

檢查國產AI加速器晶片的生產線 / TokenPost.ai

智譜推出GLM-5.3-FlashX,主打基於10萬枚國產晶片的最高200 tokens/s推理速度,並同步啟用API與體驗中心。

智譜表示,GLM-5.3-FlashX基於10萬枚國產晶片提供的推理運算能力提升速度。PANews報導指出,公司也追加投入基礎設施與推理最佳化。

此次發布不僅聚焦模型本身的效能,也強調實際服務運作所需的推理基礎設施。推理是模型根據輸入生成回應的過程,處理速度會受到模型架構、硬體配置與軟體最佳化影響。

GLM-5.3-FlashX的基礎模型GLM-5.3-Flash於8月26日公開。該模型共有3200億個參數,單次推理過程中啟用的參數為180億個,並支援100萬 tokens的上下文視窗。相關規格與公開時間也載於模型文件。

總參數代表模型擁有的整體訓練權重規模;啟用參數則是處理輸入時實際參與計算的部分,有助於在維持整體規模的同時,降低單次請求所需的運算量。

100萬 tokens上下文視窗代表模型單次請求可處理的輸入與對話記錄範圍。不過,上下文視窗大小與實際回應速度是不同指標,因此不能據此認定模型在處理長輸入時仍能維持相同的最高速度。

智譜將GLM-5.3-FlashX的最高推理速度列為200 tokens/s。這是公司公布的最高值,一般使用者實際體驗到的平均速度,可能會因請求類型與運作環境而有所不同。

公司此次未公布平均處理速度、晶片製造商、服務價格及各模型的效能比較數據。因此,200 tokens/s是在何種輸入長度與硬體配置下測得,仍有待後續營運資料確認。

GLM-5.3-Flash在公開前曾以「Ox Alpha」為名進行匿名測試。正式模型名稱公開後,確認其屬於智譜的GLM-5系列,此次FlashX發布則代表該系列進一步進入API與體驗服務應用階段。

API是外部服務或開發者呼叫模型功能的連接方式;體驗中心則讓使用者無須另行建置服務,即可測試模型回應。兩項功能同步啟用,顯示智譜試圖同時提供模型公開與實際使用環境。

GLM-5.3-FlashX的實際效能,仍需透過後續公布的詳細基準測試與API營運資料比較。公司所稱最高速度是在何種條件下測得,以及是否同步公開平均處理速度,將成為後續觀察重點。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1