Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Terminal-Bench 2.0提升8.3個百分點:研究提出選擇性記憶介入

檢視失敗節點的AI代理人工作紀錄 / TokenPost.ai (mono)

長期執行任務的人工智慧(AI)代理人採用「只在必要時注入記憶」的架構後,Terminal-Bench 2.0表現提升8.3個百分點。這套方法由獨立的記憶代理人管理工作中的關鍵資訊,只有在行動代理人可能偏離路徑或重複犯錯時才介入。

論文《Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents》提出與行動代理人分開運作的記憶代理人。記憶代理人會檢視近期工作紀錄,將需求、環境資訊、過往失敗經驗與目前進度整理至結構化記憶庫。

研究團隊將長期任務中「即使必要資訊仍留在對話紀錄裡,卻無法充分控制後續行動」的現象稱為「behavioral state decay」。這項研究的重點不是儲存更多資訊,而是判斷何時應重新介入行動。

在使用Claude Sonnet 4.5作為行動代理人的實驗中,Terminal-Bench 2.0的pass@1由37.6%升至45.9%,提高8.3個百分點;τ²-Bench的任務加權平均分數也由55.0%升至61.8%,提升6.8個百分點。

另一項使用Claude Opus 4.6的實驗中,Terminal-Bench 2.0由43.5%升至45.9%,τ²-Bench則由66.2%升至68.7%。

Terminal-Bench 2.0的結果以全部89項任務中,雙方評估均有效的85項任務為計算基準。研究團隊指出的表現數據僅限於這兩項基準測試。

關鍵在於不讓記憶在每個階段都暴露。記憶代理人會管理穩定事實與需求、過往嘗試與失敗,以及目前進度;當行動代理人正常運作時,記憶代理人不會介入。

只有在行動代理人可能偏離路徑或重複相同錯誤時,記憶代理人才會發送簡短提醒。研究團隊表示,相較於每次公開完整記憶,或在所有階段發送提醒,「選擇性介入」更有效。

過去AI代理人的記憶機制多半著重於儲存資訊,或依照使用者要求進行搜尋。這項研究的特色在於不修改既有行動模型,只需額外加入獨立的記憶代理人。

這項研究也出現在長期執行型AI代理人逐步拓展至寄送電子郵件、管理行程與預訂旅程等多階段任務之際。Meta於9月8日公開個人型AI代理人Muse。

Muse設計為在專用虛擬機器中連接瀏覽器與應用程式,執行多階段任務。Meta表示,Muse會根據使用者目標制定計畫並持續完成工作。

Muse存取外部服務時,會由獨立的Sentinel系統核准或拒絕,必要時也會要求使用者確認。Meta表示,使用者的密碼與驗證資訊不會直接暴露給代理人。

不過,Meta的官方Muse公告與安全文件並未提到Muse使用本論文提出的Proactive Memory Agent。Crypto Briefing曾提及兩項技術可能存在關聯,但官方資料尚未確認兩者已直接整合。

AI代理人長期記憶的驗證與管理研究,先前也出現在微軟將AI記憶驗證後的通過率由39%提高至73%的案例。本次論文則更著重於工作執行期間選擇介入時機,而非在儲存記憶前進行驗證。

本論文與Muse均未提出虛擬資產錢包管理或鏈上自動化應用案例。研究成果能否在實際商用服務中重現相同水準,仍需進一步驗證。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1