Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

成功率96.9%!Meta(META) AI提出LLM代理執行層訓練法EvoHarness-RL

貼著彩色標籤的研究文件與效能圖表 / TokenPost.ai

Meta(META) AI與UIUC(伊利諾大學厄巴納-香檳分校)研究團隊共同提出一套名為EvoHarness-RL的訓練方法,讓長時間任務型大型語言模型(LLM)代理學習「執行層」的操作方式。在ALFWorld基準測試中,Qwen3-8B模型的平均成功率從ReAct的47.9%大幅提升至96.9%。

研究團隊於韓國時間8月6日上午7時29分公布在arXiv的論文中指出,長時間互動型代理在維持狀態、追蹤進度、呼叫工具、驗證結果與重複利用經驗時,高度仰賴外部執行支援。Hugging Face的Daily Papers也介紹了這篇論文

這項研究的重點不在於為代理增加更多工具或記憶體,而是讓代理學會判斷「何時」該讀取、更新、調用、記錄外部狀態。

研究團隊將外部狀態分為信念(Belief)、進度(Progress)與經驗(Experience)三類。信念代表代理對目前環境的判斷,進度代表已完成與未完成的任務流程,經驗則是從過去任務中累積、可重複利用的知識。

代理依據這三種狀態,選擇追蹤(track)、提交(commit)、回想(recall)、紀錄(note)等執行層動作。追蹤是讀取狀態,提交是記錄進度,回想是調用過去經驗,紀錄則是留下新取得的資訊。

訓練分為兩個階段。研究團隊先以監督式學習讓模型熟悉執行層的使用方式,接著採用具成本意識的群組相對策略最佳化(GRPO),調整模型在何種情況下需要存取外部狀態。

從數據來看,提升幅度相當可觀。論文表格顯示,以Qwen3-8B為基礎的EvoHarness-RL,在ALFWorld seen split的140項任務中,平均成功率達到96.9%,相同條件下的ReAct僅為47.9%。

作為比較對象,SkillOS的成功率為80.2%,SkillRL為89.9%。Claude Opus 4.5在ReAct設定下為96.4%,套用EvoHarness-Base後則提升至98.5%。

在未曾見過的環境中,差距依然存在。Qwen3-8B在unseen split的成功率,從ReAct的50.0%提升至EvoHarness-RL的86.6%。

不過,這樣的效能提升並非全部歸功於強化學習。同一篇論文顯示,在Qwen3-8B加上提示詞層級BPE執行層的EvoHarness-Base,在seen split的成功率為56.4%,監督式學習版本的EvoHarness-SFT則為68.6%。

在unseen split中,EvoHarness-Base為77.6%,EvoHarness-SFT為69.4%,EvoHarness-RL為86.6%。這顯示執行層架構本身,與判斷何時使用它的策略,兩者是共同發揮作用的。

執行層(harness)是讓LLM代理在實際任務環境中運作的基礎架構,負責管理模型該記住什麼、該呼叫哪些工具、失敗時該回復到什麼狀態,以及如何留下作業紀錄。

這項議題對AI與加密貨幣領域的讀者同樣重要。隨著代理被用於鏈上分析、錢包追蹤、安全檢查與自動化輔助工作,執行結構是否可驗證,重要性正逐漸超越模型名稱本身。本網先前報導指出,執行層設計已成為有別於模型訓練的另一項效能提升途徑

長時間任務型代理相較於單次回覆,更仰賴多階段執行、狀態追蹤與失敗復原能力。也有分析指出,企業用AI代理的競爭焦點,已從模型效能轉向包含上下文管理、權限控管、錯誤復原與驗證機制在內的營運系統

不過,目前公開的資料較接近基準測試與概念驗證。是否已在實際企業營運環境中,針對延遲、成本、安全性與故障復原等面向完成驗證,尚未獲得確認。

這篇論文顯示,代理效能的瓶頸不只在於模型規模,也在於處理外部狀態的方式。論文並提到,EvoHarness-RL已獲2026年COLM長時間語言代理研討會(LLA@COLM 2026)採用。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1