輝達(NVIDIA)研究團隊透過在執行前驗證端末代理提出的指令候選,提升了基準測試成功率。在 TerminalBench-Lite 實驗中,Pass@1 從基礎代理的 50.00% 升至 68.03%。
研究團隊公開的「Mid-Harness」會讓代理在每個工作步驟提出多個指令候選,再由驗證模型評估並選出一個執行。輝達在研究頁面說明,錯誤指令可能影響後續工作環境,因此加入執行前驗證步驟。
實驗中由 TMAX-9B 產生指令候選,GPT-5.6 Sol 負責驗證。每個步驟產生 8 個候選時,Pass@1 從 50.00% 提高至 68.03%。Pass@1 指工作只嘗試一次時的成功比例。
研究團隊表示,單靠增加候選數量不一定能提升表現。若驗證能力不足,即使增加候選也難以發揮效益,因此能挑出有效行動的驗證器相當重要。在由 TMAX-9B 同時負責候選生成與驗證的實驗中,受測方法裡以成對驗證的結果最佳。
研究團隊也比較了從頭多次執行同一工作的「軌跡擴展」,以及在每個步驟增加候選的「行動擴展」。輝達研究頁面指出,在 TMAX-9B 搭配 TerminalBench-Lite 的測試中,兩種方式併用時,成功率高於只增加軌跡的做法,估計 token 成本也較低;頁面未提供具體的成本降幅。
Mid-Harness 測試的是一種不必更換模型或重新訓練、只在生成行動即將執行前加以檢查的架構。不過,公開數據僅來自特定基準測試;在實際端末工作或較長的工作流程中是否也有相同效果,目前尚未確認。
留言 0