Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

10項AI代理基準測試發現219項缺陷 評分能否反映實際能力受質疑

評分標準所示的基準測試評分表 / TokenPost.ai (macro)

加州大學柏克萊分校研究團隊稽核10項AI代理基準測試,發現219項缺陷,顯示單憑分數難以判斷模型執行實際任務的能力。

研究團隊在2026年5月12日公開的論文中表示,他們使用稽核工具「BenchJack」,找出無須完成任務也能取得高分的漏洞。10項基準測試中,有9項可透過攻擊方式,在未執行實際任務的情況下取得接近滿分的成績。論文原文

研究團隊表示,他們三度修改網頁操作評測WebArena與桌面任務評測OSWorld,移除可遭利用的任務。缺陷包括代理與評測系統未充分隔離、答案資訊外洩,以及評分邏輯存在漏洞。

研究團隊也提出檢查清單,涵蓋隔離評測環境、保護答案資訊及檢查評分方式等項目。未實際解決任務、而是利用評測漏洞提高分數的行為,稱為「獎勵駭客行為」(reward hacking)。

這項研究並未否定所有基準測試分數。不過,若評測環境或評分方式存在缺陷,分數可能無法準確反映模型的實際能力,因此難以只憑基準測試排名或分數,斷定模型在實務上的表現。

研究結果應與Anthropic「10月底最佳AI模型」預測市場價格分開看待。Polymarket合約頁面顯示,截至10月3日中午12時45分(台灣時間),Google為64%、Anthropic為37%。合約預計於10月31日前後結算。Polymarket合約頁面

預測市場價格反映交易參與者對合約結果的集體評估,並非直接衡量模型客觀排名的指標,也無法單憑價格判定波動原因。

因此,目前無法確認這項研究與Anthropic合約價格變化之間存在因果關係。研究提出檢視基準測試評估可靠性的必要性,但並未判定Anthropic模型的競爭力。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1