Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Scale AI推出HarnessOpt-Bench:測試AI能否自我優化執行架構

擺放評估圖表與筆記型電腦的研究書桌 / TokenPost.ai

Scale AI推出全新評估基準「HarnessOpt-Bench」,測試大型語言模型能否親自修改代理(agent)的執行架構藉此提升效能。這項基準不只看模型能不能給出正確答案,還把提示詞、工具、控制流程、記憶與協調程式碼的處理能力一併納入考核。

Scale AI在6日公布的論文中,將「執行架構」(harness)定義為運作於模型之外的提示詞、工具、記憶、控制流程與協調程式碼。研究團隊的出發點是,即便使用同一個模型,搭配不同的執行架構也可能讓任務表現出現落差。

這次基準測試的設計是,讓「優化模型」取得目標代理的初始執行架構、評估回饋與固定的評估預算後,自行修改程式碼並提交最終版本。最終分數以不公開的測試區段為準,計算相較初始架構的改善幅度,而這個測試區段在搜尋過程中無法被存取。評估邊界與預算則由可信任的執行環境統一管理。

Scale AI在實驗中,將Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra與Kimi K3等5款前沿大型語言模型作為「優化模型」進行評估。測試任務共有OfficeQA、BrowseComp Plus、TerminalBench、GAIA等4項,整體評分執行次數達111次。

結果顯示,模型本身的差異比執行架構的差異更明顯。Scale AI指出,在任務與執行架構固定的情況下,更換優化模型會讓平均成效變動0.142;而在任務與模型固定、只更換執行架構時,平均成效變動則為0.079。不過,原生執行架構並非在每次測試中都能取得較佳結果。

各項任務的細部表現也互有高低。在OfficeQA任務中,Claude Opus 5搭配OpenCode組合的正規化成效達到0.63;在GAIA任務中,GPT-5.6 Sol搭配Codex組合則為0.49。Scale AI也提醒,若差距小於各任務評估雜訊的範圍,就不應視為具有確定性的差異。

律動BlockBeats(BlockBeats)針對這項基準測試表示,它其實是在檢驗AI能否像研究員一樣設計實驗、執行訓練並修正方法。報導提到,部分模型確實透過執行實驗、調整參數與反覆優化,在若干任務上超越了基準線;但面對最新研究時,多數嘗試仍停留在既有論文提出的方法與參數調校上,未見明顯突破。評論來看,這說明現階段AI在既有框架內的優化能力已相當成熟,但要獨立提出突破性研究方向,恐怕還有一段距離。

這項結果顯示,AI代理的評估重心正從「模型單獨表現」擴大到「執行架構」層面。AI代理的應用範圍也持續擴大,延伸到程式撰寫、研究與終端機操作等需要長時間操作工具的領域。本報先前也報導過,騰訊推出的WorkBuddy Bench以真實工作任務為基礎比較各家程式碼代理的表現

Scale AI這篇論文的意義在於,把「執行架構優化」變成一項可重複驗證的評估項目。不過,僅憑這次結果,還很難斷定AI已經能夠獨立發想全新的研究構想。

查證來源:Scale Labs HarnessOpt-Bench論文(https://labs.scale.com/papers/harnessopt-bench)、論文PDF(https://static.remotasks.com/uploads/6a74bd9cebda5487911dfbc2/HarnessOpt-Bench.pdf)、BlockBeats原文(https://www.theblockbeats.info/flash/362187

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1