GPT-6 Astra在綜合人工智慧效能指標中取得166分,於249個追蹤模型中排名第一。不過,該模型在軟體工程評測中的得分僅47%,顯示模型的專業領域表現可能與綜合排名不同。
Epoch AI表示,GPT-6 Astra是於2026年9月3日發布的封閉模型,在Epoch能力指數(ECI)中取得166分。GPT-5.5 Pro為162分,Claude Fable 5.1則為164分。
ECI並非單一測驗結果,而是將多項人工智慧基準測試整合為一般能力指標。Epoch AI說明,該指數會彙整超過50項基準測試結果,用於比較不同模型的效能。
ECI計算會對高難度評測中表現較佳的模型給予較高分數。因此,ECI更接近整合多項評測結果的比較指標,而非衡量單一工作的效能。
GPT-6 Astra在各領域的成績並不完全平均。該模型在數學評測 FrontierMath Tier 4取得98%,在科學與推理評測 GPQA Diamond取得96%。
相較之下,GPT-6 Astra在軟體工程評測 MirrorCode取得47%。同一項評測中,Claude Fable 5.1取得73%,較GPT-6 Astra高出26個百分點。
這顯示,即使模型在綜合指標中領先,仍可能在特定專業領域落後競爭模型。僅憑ECI排名,難以判斷模型在程式設計、數學與科學等所有工作中的優勢。
GPT-6 Astra是OpenAI於9月3日公開的模型。OpenAI將其定位為面向電腦操作、瀏覽、軟體工程、網路安全、科學及專業工作的模型。
OpenAI表示,GPT-6 Astra在FrontierMath Tier 4取得98%,與Epoch AI公布的該項評測結果一致。
ECI分數可能隨時間變動。Epoch AI電子報在模型發布後不久曾將GPT-6 Astra的ECI介紹為169分,但目前模型頁面顯示為166分。
Epoch AI說明,新增模型或基準測試結果後,既有模型的分數也可能調整。不過,造成兩項數值差異的具體計算變更內容尚未公布。
ECI應被視為在同一計算體系下比較模型的指標,而非絕對能力分數。由於評測項目與計算方式可能不同,同一模型的排名與分數也可能改變。
API價格為每100萬個輸入Token 10美元(約1萬3500韓元),每100萬個輸出Token 50美元(約6萬7500韓元)。OpenAI已分階段向API及付費用戶開放GPT-6 Astra。
OpenAI表示,GPT-6 Astra可用於複雜推理、程式設計、電腦操作、研究與文件撰寫。評估實際用途時,仍需同時檢視綜合指數、工作別基準測試與API成本。
目前公布的數據顯示,GPT-6 Astra在綜合ECI中居首,但在MirrorCode評測中落後Claude Fable 5.1。模型的適用範圍仍需結合綜合排名與專業領域表現進行比較。
留言 0