Perplexity將實際使用者工作階段中的錯誤與修正內容納入模型訓練後,工具呼叫失敗率從2.24%降至1.77%,相對降幅為21.2%。
Perplexity於21日在研究部落格〈Learning from Real-World Mistakes〉公布兩個後續訓練檢查點的線上A/B測試結果。這項數據並非基礎模型GLM 5.2與後續檢查點的直接比較結果。
這套訓練方式旨在補足拒絕採樣微調(RFT)的限制。RFT只挑選成功工作階段進行模仿學習;新方法則從成功工作階段學習有效行為,並根據失敗工作階段中的使用者修正與工具錯誤,找出需要修正的環節。
修正階段採用在策略自蒸餾(OPSD)。同一模型分別擔任教師與學生,只有教師模型會獲得說明錯誤原因的簡短提示。學生模型看不到提示,而是學習教師模型對下一個token的預測。
Perplexity另行重現了985個出現工具錯誤的工作階段。提供提示後,避開原有錯誤的比例從75.1%升至93.7%,實際執行修正行為的比例則從60.6%升至82.3%。
不過,這項實驗測量的是避開錯誤的能力。避開錯誤並不等同於工具呼叫成功,也不代表整體任務一定完成。
離線評估顯示,基礎GLM 5.2的工具錯誤率為2.79%,僅採用RFT的檢查點為1.35%,同時採用RFT與OPSD的檢查點則為0.87%。Perplexity表示,各檢查點的訓練資料不同,因此這並不是只控制OPSD變因的實驗。
以任務為單位的表現也沒有在所有項目中一致改善。因此,僅憑離線數據,仍難以單獨確認OPSD降低工具錯誤率的效果。
線上實驗共進行兩次。第一次實驗中,早期RFT與OPSD檢查點的工具失敗率為2.82%,低於GLM 5.2的2.94%,但差異未達統計顯著。
直到後續比較兩個RFT與OPSD檢查點的實驗,才確認工具失敗率從2.24%降至1.77%的顯著下降。Perplexity並未公布後續檢查點與GLM 5.2的直接比較結果。
使用者滿意度也沒有獲得統計上的改善。在後續實驗中,中度以上不滿意的機率從前一個檢查點的2.58%降至後一個檢查點的2.54%,但差異並不顯著。
相關研究DART-SD論文指出,在多階段工具呼叫過程中,如果連同已正確完成的部分一併重新訓練,可能損害有效的探索行為。該論文提出只針對錯誤開始後的臨界點及其後續復原階段進行選擇性訓練,但所用方法與模型並不等同於Perplexity的實驗。
AI代理會連續使用搜尋、搜尋結果解讀及外部API呼叫等多種工具。若請求格式錯誤,或誤解工具回應,可能導致最終答案出錯;不必要的工具呼叫也可能增加計算成本與回應延遲。
在這種架構下,代理不只是一次載入所有工具,如何找到並呼叫必要工具同樣重要。正如先前AI代理只載入必要工具的方式所介紹,工具連接與錯誤復原已成為需要獨立管理的課題。
Reddit的Perplexity社群中,有部分使用者回報長時間搜尋後工具呼叫中斷或發生錯誤。這屬於個別使用者經驗,不能直接與Perplexity公布的全體使用者統計結果連結。
這項結果顯示,AI代理訓練不只能利用最終答案是否成功,也能將搜尋與外部工具呼叫過程中的錯誤納入學習訊號。不過,公開數據只能支持工具呼叫可靠性改善,不能據此擴大解讀為使用者滿意度或整體任務成功率同步提升。
留言 0