Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

GLM-5.3 AI代理將推理吞吐量提升3.2倍

檢查推理效能圖表的工作畫面/TokenPost.ai

基於GLM-5.3的基礎設施AI代理,參與GLM-5.3-Flash推理系統優化,將端到端吞吐量較初始水準提升3.2倍,從首次執行到承接全部生產流量耗時不到2週。

智譜(Zhipu)表示,基於GLM-5.3的基礎設施AI代理參與了GLM-5.3-Flash推理系統改善。該代理反覆進行程式碼修改、效能檢查與原因分析。

這起案例受到關注,在於AI代理不只負責撰寫程式碼,也能測量執行結果並決定下一步修改方向。這代表部分效能優化工作已自動化,並應用於實際生產環境。

唐杰(Tang Jie) 智譜共同創辦人兼首席科學家表示,代理最容易卡住的地方不是撰寫程式碼,而是找出問題根源。他指出,即使確認一次修改導致吞吐量下降20%,仍需進一步分析問題發生在哪一層,以及下一步應檢查什麼。

智譜將資深工程師追蹤效能問題的方法,轉化為AI代理可使用的工具。代理修改程式碼後,會確認結果是否正常,並分析執行時間消耗在哪些部分。

接著,代理會比較多種方案,找出更快的方法後再次修改程式碼。這不是只觀察單次修改結果,而是先提出假設、進行實驗,再將結果反映到下一輪工作的循環流程。

代理找出了長上下文處理中的計算誤差、KV傳輸瓶頸,以及解碼核心重複計算等問題。其中,重新撰寫一個核心後,處理速度提升1.71倍。

核心是執行AI模型運算的低階程式碼單位。即使使用相同模型,核心的執行方式與資料傳輸結構不同,也可能影響推理速度和資源使用量。

KV傳輸是將推理過程中產生的中間狀態資訊,傳送至其他運算階段或裝置。若這個流程出現瓶頸,即使模型本身效能不變,整體回應吞吐量仍可能下降。

智譜先前曾公開GLM-5.3-Flash的推理效能與成本資訊。此次案例凸顯的重點,則是AI代理優化了提供模型服務的推理系統,而非模型本身的效能數據。

在這類工作中,人員負責設定目標與界線,並審查風險較高的修改內容。AI代理則負責追蹤效能下降原因,依據假設修改程式碼並進行實驗。

唐杰認為,工程師的角色將逐漸接近「設計回饋的人」。透過結合人工審查與AI代理的反覆實驗,可望縮短效能改善週期。

不過,目前仍難將這起案例視為完整的遞迴式自我改進(RSI)。唐杰表示,雖然已出現模型優化系統、系統再服務模型的「最小閉環」,但距離完整RSI仍有一段距離。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1