Claude Sonnet 5.5(Max)在 Agent Arena 公開排名中,以 12.52% 的淨改善分數名列第 3。它與第 4 名 GPT-6 Astra(Max)相差 0.25 個百分點,小於 Sonnet 5.5 的誤差範圍。
Arena.ai 於 10 月 2 日公布的排行榜顯示,Claude Fable 5.1(Max)以 14.31% 排名第 1,Claude Opus 5.5(High)以 13.82% 位居第 2。GPT-6 Astra(Max)的分數為 12.27%。
Sonnet 5.5 的誤差範圍為 ±3.09%。這次結果顯示它在這項評測中名列前段,但難以據此認定其表現明確優於 GPT-6 Astra。
Agent Arena 的評測方式不同於一般問答偏好測試。Arena.ai 表示,該平台會綜合實際代理任務中的任務成功率、使用者回饋與工具使用等訊號,並與平均水準的協調器比較,計算淨改善分數。這項分數概括代理系統執行任務的改善幅度,並不代表模型在所有工作上的優劣。
排行榜也列出效能分數、成本與輸出量。Sonnet 5.5 每項任務的成本中位數為 2.76 美元(約新台幣 90 元),輸出 token 中位數為 11 萬 5800 個。Anthropic 公布的 token 定價為每 100 萬個輸入 token 2 美元(約新台幣 65 元),每 100 萬個輸出 token 10 美元(約新台幣 325 元)。每項任務的成本會隨用量和任務內容變動,因此只看 token 定價難以判斷實際成本效益。
Anthropic 於 9 月 28 日發布 Sonnet 5.5,並強調其程式撰寫與多步驟任務能力。由於公司自有評測與 Agent Arena 排名採用的設定和標準不同,兩者無法直接以相同指標比較。比較代理模型時,除了效能排名,也應檢視實際任務的成本與 token 用量,例如先前公布的 GPT-6 Sol 在 Agent Arena 的分數與價格。
留言 0