Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

GLM-5.3效能提升 智譜AI:關鍵在後訓練而非參數規模

科技研討會講台前,講者背影 / TokenPost.ai

智譜AI旗下GLM-5.3的討論,正把大型人工智慧(AI)模型的競爭焦點,從單純比拼參數規模,擴大到「後訓練」與實際運行效率。即使採用相同的基礎模型,只要擴大長程任務環境與強化學習的訓練規模,程式碼撰寫與資安相關作業的表現就可能出現明顯差異。

根據TechFlow的報導,智譜AI(Z.ai)創辦人唐杰(Tang Jie)於19日(北京時間)發文表示,大型模型的擴展不能只看參數數量,還須一併考量資料規模、運算資源分配、推論成本與實際運行條件。TechFlow刊出該篇報導的時間為當地時間19日上午11時32分,換算台灣時間同樣是19日上午11時32分,台灣與中國大陸同屬UTC+8時區。

唐杰說明,早期的擴展法則中,參數量的成長速度快於資料量,這也讓部分超大型模型出現資源分配失衡的情況。後續研究則逐漸轉向讓模型參數與訓練資料更均衡成長的方向。

核心在於「後訓練」。後訓練是指基礎模型建成後,針對特定任務環境與獎勵機制重新提升效能的過程。如果說預訓練是拓展語言與知識基礎的階段,後訓練則更接近依照實際使用方式調整回答與行為的階段。

唐杰表示,GLM-5.3採用與GLM-5.2相同的基礎模型、架構、總參數量與活躍參數量,差異在於歷時一個月、針對長程任務環境與「強化學習」擴展所進行的後訓練。

這項說明讓外界難以再單純用「規模競賽」來看待大型模型的競爭。相較於重新訓練更大的模型,在既有基礎模型上疊加更長的執行路徑、更多任務環境與獎勵機制來提升效能的路徑,因此受到關注。

在專家混合(MoE)模型中,總參數量與活躍參數量所代表的意義也有所不同。唐杰解釋,總參數量與模型可容納的知識容量有關,活躍參數量與有效深度則與實際推論能力關係更直接。也因此,單一的「每參數訓練token數」比例,已難以完整說明模型效率。

推論成本同樣被列為變數之一。模型調用頻率愈高,實際成本就可能在服務營運階段累積得比訓練階段更多。在這種情況下,以較小模型延長訓練時間的策略,被視為成本與效能之間的平衡點之一。

評論:後訓練路線若能持續發揮效益,對資源相對有限的中小型AI團隊或許提供另一種技術路徑,不過實際效果仍須更多獨立測試驗證,不宜提前定論。

智譜AI稍早已將GLM-5.3定位為強化程式碼撰寫效能的新一代大型語言模型並正式推出,公司表示將先透過GLM Coding Plan與ZCode平台提供服務,API與開放權重(open weights)則會在完成安全性評估後分階段釋出。

開放權重是指模型架構與訓練後的參數值,可供外部開發者直接下載運用的形式。對開發者而言,這種方式的應用範圍比僅開放API的封閉式作法更廣,但也伴隨部署範圍與安全性驗證等相應要求。

智譜AI的開發文件同樣將GLM-5系列的重點放在長程代理(agent)任務、非同步強化學習與長文本處理效率上。所謂長程代理任務,是指相較單次回答,需要持續進行多階段規劃、執行與驗證的作業。

這股趨勢也間接牽動區塊鏈開發者。智能合約審計、程式碼審查、漏洞偵測與自動化開發工具,都會受到程式碼AI模型效能與安全機制的影響。不過,目前公開資料並未顯示GLM-5.3與特定加密貨幣或區塊鏈項目有直接關聯。

目前的效能評估仍主要根據公司公開資料與外部報導。實際開發現場的穩定性、成本效益與安全控管水準,須待API與權重全面公開、並經獨立評測後才能進一步比較。

唐杰在文章中,將參數規模、預訓練資料、前向運算與後訓練皆視為可各自調整的擴展變數。GLM-5.3案例顯示,大型AI模型的競爭,已難單純以「打造更大的基礎模型」來解釋。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1