Google研究團隊提出「Dream-RSI」,透過重用過往探索紀錄降低AI代理的呼叫成本。在Lasso正則化路徑問題中,Dream-RSI較既有方法最多減少162倍代理呼叫;但在使用相同模型與設定的比較中,呼叫量降幅約為1.7倍。
Google DeepMind、馬里蘭大學與維吉尼亞大學研究人員於14日透過arXiv論文介紹Dream-RSI。這套方法不重新訓練基礎AI模型,而是改善編排層,調整探索順序、平行處理方式與中止時點。
Dream-RSI分為三個階段。首先,AI代理在線上尋找候選解法,並將每次嘗試與結果記錄在「探索樹」中,接著轉換為「重播模擬器」,用於評估新的探索政策。
新政策會重播過往路徑進行測試,不必再次呼叫實際代理。研究人員表示,系統只會將表現最佳的政策投入下一輪線上探索。
其核心在於,將已執行的探索結果再次用於政策評估。重播模擬器能在實際探索過的範圍內直接呈現已儲存結果,但並非能預測從未探索區域結果的世界模型。
162倍的數字來自Lasso正則化路徑問題。SimpleTES使用gpt-oss-120b完成5萬1200次generation,Dream-RSI則以Gemini-3.1-Pro為基礎,使用317次discovery-agent call。
若直接比較兩組數字,Dream-RSI的呼叫量約少162倍。不過,由於基礎模型與設定不同,這不能視為相同條件下的對照實驗。
在相同的Gemini-3.1-Pro環境中,Recursive Fixed Exploration使用550次呼叫,平均執行時間為3587.1毫秒;Dream-RSI使用317次呼叫,執行時間為2931.0毫秒。研究人員提出的同系列比較顯示,呼叫量約減少1.7倍。
效能改善幅度依任務而異。在Lasso實驗中,Dream-RSI於6個獨立資料集上的平均執行時間低於既有的sklearn與glmnet實作。
數學最佳化方面,Dream-RSI在Sum-Difference與Circle Packing取得與選定基準相同或更高的結果;但在Autocorrelation Inequalities中,Dream-RSI得分為1.456375,低於SimpleTES的1.453675。該指標的數值越低越好。
GPU核心探索方面,Dream-RSI在VGG16與LayerNorm取得相近效能,同時分別少用2.43倍與1.79倍generation。在ConvDiv與ConvMax中,於可比較的預算下,效能則分別高出2.09倍與1.44倍。
這些結果反映的不是AI模型本身能力提升,而是對探索任務所需呼叫次數與執行順序的調整。TokenPost先前曾報導,AI代理的執行架構可能影響工作成本。
在企業連續呼叫多個模型與工具的環境中,成本不只取決於模型效能,也可能受到探索路徑能否重用影響。不過,Dream-RSI的重播方式仍取決於過往探索紀錄的範圍與品質。
專案頁面說明,重播模擬器在已記錄的探索空間內能提供準確結果,但不保證超出該範圍的結果。官方GitHub儲存庫已公開論文與互動式示範,完整程式碼庫與重現腳本仍在準備中。
因此,162倍的跨模型比較數字,以及在其他模型與任務上的成本降低效果,仍需透過進一步重現實驗確認。
留言 0