Anthropic 內部指標顯示,Claude 在已測量的模型研發工作中所占比重,從 2026 年 2 月的不到 1% 升至同年 8 月的 26%。Artificial Analysis 的指標排名由 Anthropic 領先,但衡量使用者偏好回答的 Arena 排名則由 Google 居首。
Air Street Capital 的 Nathan Benaich 於 10 月 8 日發布第九份年度《State of AI Report 2026》。報告涵蓋 AI 研究、產業、地緣政治、安全與政策,並將 Anthropic、OpenAI 和 Google 列為主要競爭者。這份自 2018 年開始發布的報告,每年整理 AI 領域變化,也檢視過去的預測。
報告用來說明 Anthropic 領先的指標,是 Artificial Analysis 的 Intelligence Index。該指數綜合推理、知識、數學與程式設計等多項評測結果;評估使用者偏好回答的 Arena 排名,則由 Google 領先。
兩項結果衡量的對象與方式不同,因此難以將單一排名擴大解讀為模型整體優劣。比較指標時,也應一併檢視評測項目與適用版本。
除了模型排名,報告也討論 AI 協助 AI 研發的趨勢,以及機器人、推理與網路安全。推理是完成訓練的模型處理實際請求並產生結果的過程。AI 代理在執行任務時若反覆呼叫模型,除了模型開發成本,執行所需的運算與基礎設施也會變得重要。
報告引用 Anthropic 內部指標指出,在已測量的模型研發工作中,Claude 所占比重從 2026 年 2 月的不到 1% 升至 8 月的 26%。這項數據是依 Anthropic 定義的工作項目與監督環境計算,並不表示 Claude 執行了整體 AI 研究的 26%,也不代表模型能自主進行研究。
報告作者表示,持續且完全自主的自我改進階段尚未獲得證實。Claude 參與研發工作的比重,與模型是否具備獨立研究能力,是兩個不同問題。
本次報告也重新檢視去年提出的 10 項預測,其中 2 項命中、5 項部分命中、3 項落空。報告將資料中心反對聲浪列為部分命中,因為相關動向確實出現,但尚無法確認其對 11 月選舉造成影響。
先前關於 Claude 參與研發工作比重與完全自我改進階段的報導,也與本次報告討論的變化相關。報告提出的數據反映 Anthropic 內部定義的工作占比,並非 AI 研究整體的自動化比例。
留言 0