Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Claude Sonnet 5.5 登上 Agent Arena 第 3 名,與第 4 名僅差 0.25 個百分點

排名與效能分數模糊可見的評測表/TokenPost.ai (macro)

Claude Sonnet 5.5(Max)在 Agent Arena 公開排名中,以 12.52% 的淨改善分數名列第 3。它與第 4 名 GPT-6 Astra(Max)相差 0.25 個百分點,小於 Sonnet 5.5 的誤差範圍。

Arena.ai 於 10 月 2 日公布的排行榜顯示,Claude Fable 5.1(Max)以 14.31% 排名第 1,Claude Opus 5.5(High)以 13.82% 位居第 2。GPT-6 Astra(Max)的分數為 12.27%。

Sonnet 5.5 的誤差範圍為 ±3.09%。這次結果顯示它在這項評測中名列前段,但難以據此認定其表現明確優於 GPT-6 Astra。

Agent Arena 的評測方式不同於一般問答偏好測試。Arena.ai 表示,該平台會綜合實際代理任務中的任務成功率、使用者回饋與工具使用等訊號,並與平均水準的協調器比較,計算淨改善分數。這項分數概括代理系統執行任務的改善幅度,並不代表模型在所有工作上的優劣。

排行榜也列出效能分數、成本與輸出量。Sonnet 5.5 每項任務的成本中位數為 2.76 美元(約新台幣 90 元),輸出 token 中位數為 11 萬 5800 個。Anthropic 公布的 token 定價為每 100 萬個輸入 token 2 美元(約新台幣 65 元),每 100 萬個輸出 token 10 美元(約新台幣 325 元)。每項任務的成本會隨用量和任務內容變動,因此只看 token 定價難以判斷實際成本效益。

Anthropic 於 9 月 28 日發布 Sonnet 5.5,並強調其程式撰寫與多步驟任務能力。由於公司自有評測與 Agent Arena 排名採用的設定和標準不同,兩者無法直接以相同指標比較。比較代理模型時,除了效能排名,也應檢視實際任務的成本與 token 用量,例如先前公布的 GPT-6 Sol 在 Agent Arena 的分數與價格。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1