OpenAI的GPT-6 Astra在程式編寫基準測試中,拿下比Anthropic的Claude Fable 5.1更高的分數。不過,僅憑兩家公司各自公布的自評結果,仍難以判斷封閉式模型與整體開源、開放權重模型之間的效能差距。
Anthropic於9月1日發表了Claude Fable 5.1。這款模型專為長時間編寫程式與知識型工作而設計,主打能處理完整程式碼庫、撰寫測試,並操作瀏覽器等功能。
Fable 5.1的API定價為每百萬個輸入token 10美元(約1萬3390韓元),每百萬個輸出token 50美元(約6萬6950韓元)。快取讀取價格則為每百萬token 0.25美元(約335韓元),Anthropic表示一般任務成本可降低約25%,代理型(agentic)任務成本最多可減少約45%。
OpenAI則於9月3日發表GPT-6 Astra。Astra被定位為可執行程式編寫、瀏覽器操作、科學研究與專業工作的模型,將先提供給少數受限機構使用,之後才會陸續擴大至ChatGPT Plus、Pro、Business、Enterprise版本,以及API、微軟(MSFT)Azure與亞馬遜雲端服務(AWS)Bedrock。OpenAI的GPT-6 Astra API與付費用戶開放過程同樣是採漸進式部署方式進行。
根據OpenAI官方評測表,Astra在Terminal-Bench 4.0拿下57.9%,在DeepSWE v1.1拿下74.1%。同一份表格中,Fable 5.1的成績則分別為55.8%與67.4%。
換算下來,Astra在Terminal-Bench 4.0上比Fable 5.1高出2.1個百分點,在DeepSWE v1.1上則高出6.7個百分點。不過,兩者的測試環境與執行流程是否完全一致,仍需另行確認。
在電腦操作能力評測OSWorld 2.0中,Astra拿下72.6%,GPT-5.6 Sol則為65.7%。OpenAI表示,Astra在該模擬測試中,以每項任務約少47%的時間拿下更高分數。
不過,OSWorld 2.0的結果屬於OpenAI自家模型之間的比較,不能單憑這項數據解讀為與開源模型之間存在效能差距。
在這次的較量中,兩家公司強調的重點並非單純的問答能力,而是能否把任務「執行到底」的能力。兩款模型都被設計成除了生成程式碼外,還能完成瀏覽器操作、撰寫測試、錯誤修復等多階段任務。
隨著這股趨勢,模型比較的標準也正從單一答案的準確度,擴大到程式編寫代理與電腦操作能力評測。即使是同一款模型,依工具呼叫方式與執行環境不同,結果也可能出現差異,因此僅憑基準測試分數,很難斷定實際開發現場的表現。
至於原始資料中提到的網頁開發基準測試相差1800分,以及落後開放權重模型約4個月的說法,並未在官方資料中獲得證實。智慧指數(Intelligence Index)8.5分的差距,同樣不足以作為推算整體開源、開放權重生態系平均落後時間的依據。
開放權重模型指的是公開已訓練權重的模型,但這與開源在公開範圍、授權條款上並非完全相同的概念。因此在比較封閉式模型與開放權重模型時,除了效能之外,也須一併檢視價格、權重是否公開以及部署條件等因素。
Anthropic將Fable 5.1定位為適合長時間編寫程式與代理型任務的模型。OpenAI也將Astra介紹為可用於程式編寫、電腦操作、科學研究與專業工作的模型。
目前兩款模型的發表時間與主要功能已獲確認,但尚未出現在相同條件下,與整體開源模型一較高下的比較結果。若要判斷實際開發環境中的效能與成本,仍需在相同執行環境與評測流程下進行進一步驗證。
OpenAI與Anthropic預計將分別透過限量提供給特定機構,以及擴大一般用戶與API使用範圍的方式,持續拓展各自模型的供應範圍。
留言 0