基於GLM-5.3的基礎設施AI代理,參與GLM-5.3-Flash推理系統優化,將端到端吞吐量較初始水準提升3.2倍,從首次執行到承接全部生產流量耗時不到2週。
智譜(Zhipu)表示,基於GLM-5.3的基礎設施AI代理參與了GLM-5.3-Flash推理系統改善。該代理反覆進行程式碼修改、效能檢查與原因分析。
這起案例受到關注,在於AI代理不只負責撰寫程式碼,也能測量執行結果並決定下一步修改方向。這代表部分效能優化工作已自動化,並應用於實際生產環境。
唐杰(Tang Jie) 智譜共同創辦人兼首席科學家表示,代理最容易卡住的地方不是撰寫程式碼,而是找出問題根源。他指出,即使確認一次修改導致吞吐量下降20%,仍需進一步分析問題發生在哪一層,以及下一步應檢查什麼。
智譜將資深工程師追蹤效能問題的方法,轉化為AI代理可使用的工具。代理修改程式碼後,會確認結果是否正常,並分析執行時間消耗在哪些部分。
接著,代理會比較多種方案,找出更快的方法後再次修改程式碼。這不是只觀察單次修改結果,而是先提出假設、進行實驗,再將結果反映到下一輪工作的循環流程。
代理找出了長上下文處理中的計算誤差、KV傳輸瓶頸,以及解碼核心重複計算等問題。其中,重新撰寫一個核心後,處理速度提升1.71倍。
核心是執行AI模型運算的低階程式碼單位。即使使用相同模型,核心的執行方式與資料傳輸結構不同,也可能影響推理速度和資源使用量。
KV傳輸是將推理過程中產生的中間狀態資訊,傳送至其他運算階段或裝置。若這個流程出現瓶頸,即使模型本身效能不變,整體回應吞吐量仍可能下降。
智譜先前曾公開GLM-5.3-Flash的推理效能與成本資訊。此次案例凸顯的重點,則是AI代理優化了提供模型服務的推理系統,而非模型本身的效能數據。
在這類工作中,人員負責設定目標與界線,並審查風險較高的修改內容。AI代理則負責追蹤效能下降原因,依據假設修改程式碼並進行實驗。
唐杰認為,工程師的角色將逐漸接近「設計回饋的人」。透過結合人工審查與AI代理的反覆實驗,可望縮短效能改善週期。
不過,目前仍難將這起案例視為完整的遞迴式自我改進(RSI)。唐杰表示,雖然已出現模型優化系統、系統再服務模型的「最小閉環」,但距離完整RSI仍有一段距離。
留言 0