Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Claude 研發工作占比升至 26%,Anthropic 內部指標揭示

研究人員查看 AI 模型評測結果的手部 / TokenPost.ai (mono)

Anthropic 內部指標顯示,Claude 在已測量的模型研發工作中所占比重,從 2026 年 2 月的不到 1% 升至同年 8 月的 26%。Artificial Analysis 的指標排名由 Anthropic 領先,但衡量使用者偏好回答的 Arena 排名則由 Google 居首。

Air Street Capital 的 Nathan Benaich 於 10 月 8 日發布第九份年度《State of AI Report 2026》。報告涵蓋 AI 研究、產業、地緣政治、安全與政策,並將 Anthropic、OpenAI 和 Google 列為主要競爭者。這份自 2018 年開始發布的報告,每年整理 AI 領域變化,也檢視過去的預測。

報告用來說明 Anthropic 領先的指標,是 Artificial Analysis 的 Intelligence Index。該指數綜合推理、知識、數學與程式設計等多項評測結果;評估使用者偏好回答的 Arena 排名,則由 Google 領先。

兩項結果衡量的對象與方式不同,因此難以將單一排名擴大解讀為模型整體優劣。比較指標時,也應一併檢視評測項目與適用版本。

除了模型排名,報告也討論 AI 協助 AI 研發的趨勢,以及機器人、推理與網路安全。推理是完成訓練的模型處理實際請求並產生結果的過程。AI 代理在執行任務時若反覆呼叫模型,除了模型開發成本,執行所需的運算與基礎設施也會變得重要。

報告引用 Anthropic 內部指標指出,在已測量的模型研發工作中,Claude 所占比重從 2026 年 2 月的不到 1% 升至 8 月的 26%。這項數據是依 Anthropic 定義的工作項目與監督環境計算,並不表示 Claude 執行了整體 AI 研究的 26%,也不代表模型能自主進行研究。

報告作者表示,持續且完全自主的自我改進階段尚未獲得證實。Claude 參與研發工作的比重,與模型是否具備獨立研究能力,是兩個不同問題。

本次報告也重新檢視去年提出的 10 項預測,其中 2 項命中、5 項部分命中、3 項落空。報告將資料中心反對聲浪列為部分命中,因為相關動向確實出現,但尚無法確認其對 11 月選舉造成影響。

先前關於 Claude 參與研發工作比重與完全自我改進階段的報導,也與本次報告討論的變化相關。報告提出的數據反映 Anthropic 內部定義的工作占比,並非 AI 研究整體的自動化比例。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1