Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

10倍省的不是訓練成本,是實驗費:Meta AI論文掀論戰

手裡拿著的縮放定律論文與手繪圖表資料 / TokenPost.ai

Meta(META)旗下FAIR研究團隊指出,用來預測大型語言模型(LLM)訓練規模的既有「Chinchilla縮放定律」存在盲點,並提出修正版模型。不過論文所稱「運算量省10倍」,指的並非整體訓練成本下降,而是用來校準縮放定律的實驗運算量減少。

馬圖蘭·維多(Mathurin Videau)、巴德爾·尤比伊德里西(Badr Youbi-Idrissi)、大衛·羅培茲帕茲(David Lopez-Paz)、卡爾蒂克·阿胡賈(Kartik Ahuja)等研究人員在論文《Skaling: Chinchilla's Exponents Meet Kaplan's Coupling》中指出,「模型規模與訓練資料各自獨立影響損失值」這項既有假設,在部分區間會產生誤差。這篇論文在arXiv上標示的提交日期為2026年8月7日,PDF檔案的中繼資料則顯示為2026年8月10日。

Chinchilla縮放定律過去被視為在固定運算預算下,同步擴大模型規模與訓練詞元(token)數量才能達到最佳效率的準則。Google DeepMind曾在2022年發表的Chinchilla論文中說明,700億參數模型在相同運算量下,表現優於2800億參數的Gopher模型。

此後,業界普遍流傳「每個參數約需20個詞元」的經驗法則。這項邏輯認為,與其一味擴大模型規模,不如讓模型大小與資料量保持平衡,才能有效運用運算預算。

這篇新論文認為,上述架構在資料量不足或訓練過度的區間,可能低估或高估實際損失值。研究團隊因此在Chinchilla的獨立加總結構中,加入「耦合指數k」,提出名為「Skaling」的新法則。

「Skaling」不再單純假設模型規模N與訓練詞元數D各自獨立變動,而是納入兩個變數在損失曲面上共同作用的效果,藉此縮小預測誤差。

研究團隊也公布了具體改善幅度。根據論文,「Skaling」在受測的組合中有76%比Chinchilla定律更精準,中位數誤差改善幅度達2.2倍。

平均絕對百分比誤差(MAPE)依實驗條件不同,減少了1.5倍至3倍。不過,這項結果是在特定實驗網格與評估方式下得出,能否直接套用到其他模型、資料集與訓練配方,仍有待觀察。

整篇論文中最容易引發爭議的,是「10倍」這個説法。論文說明,若採用只掃描低成本區間的「L型」剖析網格,而非均勻掃過整個網格,大約能以少10倍的運算量,得到相近的預測準確度。

這並不代表大型模型正式訓練的整體成本能降至十分之一。它指的是,在正式訓練前用來校準縮放定律的小規模實驗與剖析階段,可以節省運算資源。

Meta先前在公開Llama 3(羊駝3)模型時,已經展現出不把Chinchilla標準當成絕對法則的態度。Meta在2024年曾表示,8B模型即使訓練詞元數遠超過Chinchilla最佳點所建議的約2000億個,一路訓練到最多15兆個詞元,效能仍持續提升。

Meta FAIR在2026年5月發表的《Compute Optimal Tokenization》研究中也主張,決定資料規模的關鍵應是位元組(byte)而非詞元數量,且應與參數規模成比例。相較之下,這次的「Skaling」更直接處理損失曲面的耦合結構,而非單純的詞元數與模型規模比例。

這股討論脈絡,與AI開發成本的爭論密切相關。大型模型訓練與資料中心、半導體、電力成本緊密相連,本媒先前也報導美國大型科技公司的AI設備投資競賽正在壓縮現金流

「Skaling」與其說是直接緩解這類成本壓力的技術,不如說是一套研究框架,目的是在大規模訓練前更精準地分配預算。若能降低訓練前的實驗成本,在決定模型規模與資料量時,確實有機會減少浪費。

這篇論文目前僅為arXiv預印本,尚未通過同儕審查,內容也未提出與加密貨幣或區塊鏈市場的直接關聯。就目前而言,與其解讀為產業版圖的重大變化,不如視為一場關於AI訓練效率與縮放定律修正的學術辯論,更貼近事實。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1