Salesforce AI 代理人的網頁任務成功率在不更改模型權重的情況下,由43.5%提升至93.0%。研究團隊透過演化提示詞、工具、記憶與控制流程等執行結構,改善代理人表現。
Salesforce($CRM) AI Research與Agentforce的12名研究人員在2026年7月31日提交的論文《DarwinX: Evolving Agent Harnesses Through Natural Selection》中提出上述結果。論文介紹一套不重新訓練AI模型、而是改善任務執行結構的框架。
DarwinX改造的對象是「harness」。這是指AI模型利用提示詞、工具、記憶、技能與控制流程執行實際任務的架構。
DarwinX不會反覆沿著單一路徑改進,而是同時保留多種harness變體。在不大幅破壞既有任務能力的前提下,保留能解決新任務的變體,並結合不同變體取得的功能。
最大幅度的改善出現在WebArena-Infinity評測。使用相同GPT-5.5模型時,基本harness經審核後的pass@1為43.5%,套用DarwinX的harness則達到93.0%。
pass@1是指單次嘗試中成功完成任務的比例。在1260項真實網頁任務中,基本harness成功完成548項,套用DarwinX後增至1171項。
研究也審核了成功過程是否合乎規範。無效軌跡由基本harness的293項降至套用DarwinX後的17項,論文表示,涉及存取評測領域或特權主機的類型也已消失。
不過,這項審核僅套用於研究團隊產生的軌跡。外部比較對象未接受相同審查,因此不能直接從安全性角度比較相關表現數據。
其他評測也呈現改善結果。在Terminal-Bench 2.1中,GPT-5.5的表現由75.5%升至83.2%;GPT-5.6則錄得84.7%。
在另一項暫緩評測任務TerminalWorld中,DarwinX解決了41項任務中的28項。將在Terminal-Bench 2.1中演化出的harness不經修改套用至SWE-bench Verified後,結果為84.2%。
研究人員表示,若只沿著單一路徑改善單一harness,可能提升特定任務表現,卻導致其他任務退步。DarwinX同時維持多條演化分支,重點在於降低這類表現偏差。
評測採用各基準測試的驗證器。研究並未依賴額外答案表或研究人員選出的優勝變體,而是以各項任務的驗證結果比較harness表現。
這項研究與先前將AI代理人的執行經驗累積為知識、藉此提升表現的WikiSkill研究,都呈現出不直接修改模型參數的性能改善方向。WikiSkill將成功與失敗的痕跡轉化為知識結構,DarwinX則演化包含提示詞、工具使用與控制流程在內的執行結構。
不過,研究成果與商業成果仍需區分。論文屬於研究階段結果,未提出實際產品部署或營收效應。harness重組相較於單一分支變異的具體貢獻,也尚未透過受控消融實驗分離驗證,因此在實際服務環境中的可重現性與營運成本仍有待進一步確認。
留言 0