Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

AI代理數學推理準確率達62% Meta研究:代幣用量也增加

比較分支式執行路徑的評估資料 / TokenPost.ai (macro)

一項透過多路徑改善AI代理執行環境的研究顯示,數學與程式設計基準測試成績高於既有方法。奧林匹亞等級數學推理準確率達62.0%,高於比較對象Meta-Harness的46.0%,但解題使用的代幣也更多。

Meta(Meta)、杜克大學(Duke University)與加州大學戴維斯分校(University of California, Davis)的研究團隊於9月29日在論文預印本平台arXiv公開研究《用於代理執行框架最佳化的自我改進分支混合》(Mixture of Self-Improving Branches for Agent Harness Optimization)。這篇論文尚未經正式同儕審查。

執行框架(harness)是用來設定提供給模型的資訊、可用工具,以及執行與驗證結果流程的程式碼和環境。研究團隊探討如何自動改進執行框架,而非重新訓練模型權重。

既有的Meta-Harness會建立候選執行框架,在開發資料上執行,再根據結果與搜尋紀錄提出下一個候選方案。研究團隊認為,單一路徑搜尋可能遇到瓶頸,因此將搜尋拆分為多個分支。

各分支依據不同的開發案例與改進指引調整執行框架,也會參考先前的搜尋紀錄更新後續建議。收到新輸入時,路由器會選擇適合的分支執行框架來處理。

研究團隊表示,執行框架與路由器的選擇及設定只使用開發資料,沒有使用評估測試結果。在奧林匹亞等級數學推理測試中,新系統準確率為62.0%,Meta-Harness為46.0%;論文所列相對效能提升幅度為34.8%。

在Terminal-Bench 2.0中,相對提升幅度為11.6%;在SWE-bench Lite中則為3.8%。這些數據僅適用於論文作者設定的基準測試與實驗條件。

效能提升也伴隨額外的計算成本。論文附錄的代幣統計顯示,使用兩個分支的系統,相較Meta-Harness在數學實驗中使用1.21倍代幣、在Terminal-Bench 2.0使用1.71倍、在SWE-bench Lite使用1.50倍。因此,僅憑分數提高,無法判定成本效益也同步改善。

路由器的結果也不總是優於表現最強的單一執行框架。論文指出,在另一種數學推理設定與SWE-bench Lite中,路由器分別比表現較強的單一分支少通過一個測試案例。研究團隊提出結合各分支優勢的可能性,但結果並未顯示路由方式總是勝過個別執行框架。

研究團隊僅在有限的模型、基準測試與雙分支設定下提出結果。這些資料還不足以判斷重複實驗的穩定性,或增加分支後的效能與成本。由於這仍是預印本研究,能否在更廣泛條件下重現結果,也有待驗證。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1