OpenAI的GPT-6 Sol(Max)在Agent Arena以7.68%的淨改善率排名第6,API輸入與輸出價格則較GPT-5.6 Sol促銷價各低50%。
OpenAI於22日公布GPT-6 Sol與GPT-6 Luna。GPT-6 Sol的API價格為每100萬token輸入2美元(約2738韓元)、輸出10美元(約1萬3690韓元)。與先前公布的GPT-6 Sol、Luna API價格相比,成本較GPT-5.6 Sol促銷價降低一半。
Agent Arena官方排名顯示,GPT-6 Sol(Max)以7.68%的淨改善率位居第6,GPT-5.6 Sol(xHigh)則以6.16%排名第8。
Agent Arena的淨改善率並非單一測試分數,而是綜合實際代理工作階段中的任務成功率、使用者正負面反應、修正指令執行程度、指令錯誤復原能力,以及是否呼叫不存在的工具等因素計算。
評估過程採用隨機分派與因果追蹤方式,以區分模型本身的效果與工具、代理框架配置的影響。因此,淨改善率不代表一般編程基準測試分數,也不代表模型的絕對準確率。
Agent Arena顯示的GPT-6 Sol每個工作階段成本中位數為0.74美元,GPT-5.6 Sol則為0.91美元,兩款模型的實際工作階段成本也存在差異。
GPT-6 Sol在AutomationBench 1.0.6的xhigh設定下取得33.2%分數,每項任務成本為0.27美元。這項結果同時呈現模型效能與完成單項任務所需的成本。
在DeepSWE v1.1中,GPT-6 Sol取得68.8%分數,接近Claude Fable 5的最高分69.9%。OpenAI表示,其每項任務成本約低80%。
不過,這類比較未必是在相同模型設定與評估環境下進行。同一模型的成功率與成本,也可能因推理程度、工具配置及任務類型不同而改變。
OpenAI強調,GPT-6 Sol的差異化優勢不在於追求最高效能,而在於重複性工作的成本效率。在業務自動化等需要反覆執行同類任務的環境中,除了token單價外,每項任務成本也可能成為重要指標。
名目上的API價格與實際工作階段成本可能不同。代理呼叫工具的次數、任務失敗後是否重試,以及對話長度,都會影響最終成本。
OpenAI表示,在業務自動化評估中,GPT-6 Sol的得分高於Claude Opus 5,而每項任務成本約為後者的9%。不過,這項數據來自特定評估環境,並不代表GPT-6 Sol在所有任務中都具備同樣的成本優勢。
使用者反應不一。部分使用者肯定使用量與成本下降,但部分Reddit使用者聲稱,在特定編程任務中,GPT-6 Sol比GPT-5.6 Sol更慢,或成果較弱。
Reddit使用者的評價是基於個別使用經驗。若要判斷整體效能,除了Agent Arena的淨改善率與個別基準測試分數,也需要一併觀察不同業務的成功率、工具呼叫次數及重試成本。
GPT-6 Sol的公開價格與Agent Arena排名已獲確認,但原文提及的4000多個實際代理工作階段規模,尚未在OpenAI或Agent Arena公開文件中獨立確認。GPT-6 Sol的評估結果提供了同時比較成本與效能的參考,但實際成本仍會依使用環境而異。
留言 0