Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

上下文從4K增至128K,7款開放權重模型平均表現下滑62.8%

UUID與表格項目排序完成的基準測試評估表 / TokenPost.ai

一項針對7款開放權重模型的評估發現,輸入上下文從4K增至128K後,模型平均表現下滑62.8%。研究指出,僅看模型能處理多長的上下文,難以判斷它能否準確完成連續多步驟任務。

輝達(NVIDIA,$NVDA)研究團隊於9月30日公布論文《Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability》,並提出長期任務評估方法「Long-Transduction」。Crypto Briefing報導,這項基準測試涵蓋算術計算、UUID排序、變數查詢與表格轉換等任務,要求模型持續參照輸入並逐步產出結果。

研究團隊分別調整上下文長度、輸入資料格式和各步驟的任務複雜度,測量模型表現變化。更換輸入格式後,平均表現下滑36.5%;提高逐步任務的複雜度後,則下滑39.9%。

移除輸入項目的穩定識別碼後,不同任務的表現也有所下降。UUID排序下滑64.3%,變數查詢下滑66.4%。這兩項數據反映的是論文所設定的特定任務與格式條件。

Long-Transduction旨在檢視模型能否在長時間生成過程中讀取輸入、更新狀態並持續產出結果。研究團隊關注的是,短問答或單一任務的分數,難以呈現模型在多步驟工作中的可靠程度。

研究團隊表示,這些數據來自受控基準測試,並不代表企業實際工作或所有AI服務都會出現相同幅度的表現下滑。

研究團隊建議將長任務拆分成較小單位,並為輸入項目與中間輸出加上穩定ID;也建議避免把複雜工作一次塞進長上下文中。

此次評估涵蓋算術、排序、查詢與表格轉換等指定任務。僅憑研究結果,仍無法判斷實際工作系統的準確度或導入成效。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1