美國兩大AI巨頭OpenAI與Anthropic的定價競爭,正從「每百萬token單價」轉向「單一任務總成本」的比較。中國AI模型雖然在公開報價上維持低價優勢,但在部分程式撰寫與代理型任務中,美系前沿模型能用更少的token與時間完成工作,總成本反而更低。
OpenAI在7月9日公布的GPT-5.6發表文中指出,新模型GPT-5.6 Sol在Artificial Analysis「程式碼代理指數(Coding Agent Index)」測試裡,輸出token用量不到Claude Fable 5的一半,耗時也縮短逾半,整體成本則便宜了約三分之一。這項比較並非單純比對API單價,而是以完成特定任務所需的實際花費為基準。
Artificial Analysis說明,其程式碼代理排行榜是以「每項任務平均實際支付的API費用」來衡量成本。也就是說,即使每百萬token報價較高,只要重試次數與輸出量減少,實際作業成本仍可能出現落差。
Anthropic公告,Claude Fable 5與Claude Mythos 5的定價為每百萬輸入token 10美元、每百萬輸出token 50美元。OpenAI則在7月30日宣布調降價格,GPT-5.6 Luna降幅達80%,GPT-5.6 Terra降幅為20%。
路透社(Reuters)報導指出,OpenAI此次降價是為了回應企業客戶的AI成本負擔,同時也是對中國低價模型競爭的因應之道。這也顯示,企業在選擇AI模型時,已經很難單靠報價表判斷優劣。
中國模型在公開報價上仍具優勢。深度求索(DeepSeek)旗下deepseek-chat模型,每百萬輸入token報價0.27美元,輸出token則為1.10美元。
Z.AI公布GLM-5.1定價為每百萬輸入token 1.4美元、輸出token 4.4美元。Moonshot旗下Kimi K2.6則是每百萬輸入token 0.95美元、輸出token 4.00美元。
不過,各模型的效能、速度與任務屬性都不同,若只單看價目表,比較結果恐怕會失真。以Artificial Analysis對Kimi K3與GPT-5.6 Terra的比較為例,Kimi K3的智慧指數達60,高於對手,但GPT-5.6 Terra(high版本)每百萬token報價1.74美元,低於Kimi K3的2.31美元,速度也更快。
實際使用數據同樣呈現兩種趨勢並存的樣貌。Vercel在2026年7月發布的AI Gateway生產環境報告指出,以6月數據來看,Anthropic雖然只處理了32%的token量,卻占整體支出的61%。
相對地,開放權重模型雖然處理了29%的token,支出占比卻不到4%。同一份報告顯示,DeepSeek在該閘道處理的token量占比達22.6%。
這種落差同樣牽動南韓企業與Web3新創的成本結構。像是聊天機器人、開發輔助、資安檢測、數據分析這類高頻重複呼叫的工作,token單價確實重要;但在複雜的程式碼代理或長時間自動化任務中,成功率、重試次數與輸出token量,才是左右總成本的關鍵。
本媒體先前報導的美國企業評估採用中國模型的動向,同樣與這波成本壓力有關。本媒體另一篇報導的代理型AI降低單一任務成本的實驗也顯示,決定成本高低的往往不是模型報價本身,而是執行架構與token使用量。
這場競爭也牽扯出技術安全爭議。路透社報導,美國政府一名高層官員指控,Moonshot AI在開發Kimi K3的過程中,疑似「蒸餾」了Anthropic的Fable模型,中國官方則否認相關說法。
這次的比較並不代表美國模型永遠比中國模型便宜。從公開報價來看,中國模型仍維持低單價優勢;但在部分以任務為單位的比較中,OpenAI與Anthropic旗下模型的效率反而更為突出。
企業實際支出多少,最終仍取決於模型報價、任務成功率、token使用量與路由方式等多重因素。可以預期,AI成本競爭接下來仍會同時圍繞「每百萬token報價」與「任務實際完成成本」這兩條軸線展開。
留言 0