一項針對7款開放權重模型的評估發現,輸入上下文從4K增至128K後,模型平均表現下滑62.8%。研究指出,僅看模型能處理多長的上下文,難以判斷它能否準確完成連續多步驟任務。
輝達(NVIDIA,$NVDA)研究團隊於9月30日公布論文《Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability》,並提出長期任務評估方法「Long-Transduction」。Crypto Briefing報導,這項基準測試涵蓋算術計算、UUID排序、變數查詢與表格轉換等任務,要求模型持續參照輸入並逐步產出結果。
研究團隊分別調整上下文長度、輸入資料格式和各步驟的任務複雜度,測量模型表現變化。更換輸入格式後,平均表現下滑36.5%;提高逐步任務的複雜度後,則下滑39.9%。
移除輸入項目的穩定識別碼後,不同任務的表現也有所下降。UUID排序下滑64.3%,變數查詢下滑66.4%。這兩項數據反映的是論文所設定的特定任務與格式條件。
Long-Transduction旨在檢視模型能否在長時間生成過程中讀取輸入、更新狀態並持續產出結果。研究團隊關注的是,短問答或單一任務的分數,難以呈現模型在多步驟工作中的可靠程度。
研究團隊表示,這些數據來自受控基準測試,並不代表企業實際工作或所有AI服務都會出現相同幅度的表現下滑。
研究團隊建議將長任務拆分成較小單位,並為輸入項目與中間輸出加上穩定ID;也建議避免把複雜工作一次塞進長上下文中。
此次評估涵蓋算術、排序、查詢與表格轉換等指定任務。僅憑研究結果,仍無法判斷實際工作系統的準確度或導入成效。
留言 0