微軟($MSFT)研究團隊提出一種做法:在儲存AI代理的長期記憶之前,先在實際環境中進行驗證。論文實驗顯示,資料庫探索任務的通過率從39%提升至73%,每則提問的作業代理成本則從3.38美元降至1.68美元。
微軟研究團隊在10日公開的論文《Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents》中,將此做法稱為「環境探索式記憶整理」。其架構是:在儲存候選記憶之前,由另一個獨立的整理代理以唯讀方式查詢資料庫、檔案等實際環境,藉此確認事實與適用範圍。論文原文
在既有做法中,整理代理會在任務結束後,依據作業過程中取得的資訊,將「學到的內容」寫入長期記憶。研究團隊指出,這種方式的問題在於:錯誤的解讀、僅適用於部分案例的規則,或因環境變化而過時的資訊,都可能被原封不動地儲存下來。
在環境探索式做法中,整理代理會先產生候選記憶,再查詢實際環境。根據確認結果,決定是否儲存或修改記憶,並縮小適用範圍或予以刪除。整理代理不會被授予可變更運作環境的寫入權限。
研究團隊說明,採用這套方法不需要更換既有的作業代理、檢索器與記憶儲存格式,也不必重新訓練模型,只需在驗證階段加入權限最小化的唯讀工具即可。
實驗在使用GitHub Copilot SDK打造、貼近實際運作的環境中進行。將環境探索式記憶套用於CLBench資料庫探索任務後,通過率從39%提升至73%,獎勵分數由8.60提高到22.60,每則提問的查詢次數則從8.8次降至4.7次。
作業代理每則提問的成本由3.38美元降至1.68美元。單純換算約下降50.3%,但整理代理另行呼叫所產生的成本,是與作業代理成本分開計算的,因此不代表企業整體營運成本會以相同比例下降。
研究團隊另外在6種環境中評估了90項經營顧問類任務。結果顯示,環境探索式記憶在6種環境中有5種的成本效益優於既有記憶方式,作業代理的工具呼叫次數則依任務不同減少了16%至75%。
在使用Sonnet 4.6與Opus 4.7進行的比較中,環境探索式記憶同樣較既有記憶方式取得更高的平均獎勵分數。不過,實驗主要以GitHub Copilot為基礎的有限環境,以及CLBench、APEX任務為中心進行。
這套方法的核心,並不在於增加記憶的數量,而是在代理將作業過程中取得的資訊直接一般化之前,先加入一道與實際資料對照後才轉為長期記憶的驗證程序。
唯讀查詢是指在不變更資料庫或檔案的前提下,確認候選記憶的事實與適用範圍。若要應用於企業環境,須將查詢對象與存取權限分開設定,並在驗證過程中記錄確認過哪些資訊。
加入驗證階段後,作業代理的工具呼叫或重工情形可望減少;但另一方面,在背景運作的整理代理會產生額外的呼叫成本,因此評估導入效益時,須將作業成本與驗證成本一併計算。
微軟先前已公開以450項企業型任務評估AI代理記憶表現的STATE-Bench。該基準會在客服、旅遊、購物等領域,同時衡量流程遵循度、狀態變更與作業成本。STATE-Bench介紹
另一項研究計畫Memora則提出將儲存資訊與檢索方式分離的記憶架構,可將長期任務所需的文脈token最多減少98%。微軟研究說明此次論文與Memora不同之處在於,重點並非放在記憶的表現方式,而是放在儲存前的驗證程序。
這項研究也與本刊先前報導的「AI代理競爭正從模型效能轉向企業系統」相互呼應。不過,在有限實驗環境之外能否重現相同的準確度與成本效益,仍有待進一步驗證。
留言 0