Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

78題每日評測:Livenerf持續蒐集Claude Opus 5.5基準線

78道題目評測用的正確與錯誤卡片托盤 / TokenPost.ai

Anthropic推出Claude Opus 5.5後,追蹤模型效能變化的開源專案正式啟動。Livenerf每天在相同條件下評測模型,但截至10月1日,尚未取得足以判定效能是否下降的結果。

Livenerf由個人開發者ninjahawk建立,評測對象是9月22日推出的Claude Opus 5.5。專案儲存庫表示,這是與Anthropic無關的獨立專案,採用公開規則與固定評分方式,並持續公開原始評測紀錄。

Anthropic先前對Claude Opus 5.5發布的說明,已在前篇報導中介紹。Livenerf以模型發布時的效能作為基準線,另行測量後續在相同條件下的結果分布是否出現變化。

評測題目包括GPQA Diamond、MMLU-Pro、競賽數學,以及從AIME 2025至2026年題目中選出的共2,336題。Claude Opus 5.5每題作答4次後,首次作答約答對93%。其中97%的題目不是4次全對,就是4次全錯;答對與答錯結果不一致的題目共有78題。

Livenerf將這78題作為實際追蹤面板。一直答對的題目,即使模型效能變弱也不易顯現變化;一直答錯的題目,也難以區分模型是否改善。專案每天評測每道題1次,評分不是由語言模型判定,而是與正確答案進行精確比對。

評測期間為30天。前10天作為發布初期的基準線,之後比較兩個各10天的區間。預先登錄文件記載,第一個基準線區間自2026年9月24日開始。

截至10月1日,基準線仍在蒐集中。9月30日時,第一個區間已累積7天資料;必須等到兩個比較區間都結束後,才能作出最早的判定。

判定標準也已事先訂定。連續兩個10天區間與基準線的差異,在99%信賴區間內不得包含0,且每次變化幅度都必須至少達到3個百分點。

Claude Opus 5作為對照組。在相同評測環境下,如果兩個模型同步變化,便會被歸類為工具或平台變化,而非特定模型本身的變化。

不過,Livenerf的敏感度存在限制。Livenerf的預先登錄文件指出,在10天區間內,約7.5個百分點的準確率變化才可能被偵測;低於這一幅度的變動,可能會被統計雜訊掩蓋。

在驗證過程中,將Claude Opus 5.5替換為Claude Opus 5的實驗,準確率下降3.8±6.3個百分點,但在99%標準下無法區分出差異。Token使用量也減少23%,但這種程度的變化同樣難以透過該評測方式確認。

測量路徑也有所限制。Livenerf評測的不是API原始模型,而是透過Claude Max訂閱、以無頭模式Claude Code提供的Claude Opus 5.5,CLI版本固定為2.1.280。

推理強度、提示詞、評分器與執行條件均保持固定,但實際使用者接觸到的預設設定,以及工具與記憶功能的變化,並未全部納入。因此,Livenerf測量的對象,與其說是API模型本身,不如說是透過Claude Code提供的Claude Opus 5.5。

Anthropic過去曾將Claude Code的品質爭議,說明為模型本身變化與服務組成要素共同造成的問題。2025年9月的事後分析涉及基礎設施錯誤與上下文視窗路由錯誤;2026年4月的更新則說明預設推理強度、思考快取與系統提示詞的變更。Anthropic的事後分析顯示,服務層的變化可能影響使用者感受到的品質。

Livenerf與其說是能立即回答模型是否「偷偷變弱了」的工具,不如說是長期記錄模型發布後、在相同條件下效能分布是否移動的測量裝置。首次判定預計在30天評測與兩個10天比較區間完成後進行。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1