GPT-6 Astra在數學推理基準測試FrontierMath Tier 4(v2)中取得97.6%。不過,「Major Advance」並非這項分數所對應的等級,而是另一項解題計畫的成果分類。
OpenAI在官方公告中表示,GPT-6 Astra是在自有研究環境或API中接受評估後取得上述分數。同一表格顯示,GPT-5.6 Sol為83.0%,Claude Fable 5.1為87.8%。
OpenAI說明,評估環境與實際服務之間可能存在系統提示詞與工具差異,因此這項數據應解讀為特定評估條件下的結果。
FrontierMath Tier 4(v2)測試研究層級的數學問題。Epoch AI表示,完整題庫共有338題,其中295題屬於Tiers 1至3,43題屬於Tier 4。
Epoch AI表示,2026年6月12日修正題目錯誤時,修改了全體題目的42%。由於題庫曾經調整,比較評估結果時必須一併確認版本與題目組成。
「Major Advance」不是Tier 4的分數區間,而是Epoch AI另一項計畫「FrontierMath: Open Problems」用來評估數學成果重要性的分類,層級低於「Breakthrough」。
Epoch AI將「廣泛數學領域的研究人員會關注成果,並試圖理解解法概要」的結果定義為「Major Advance」。換言之,這是評估解題學術意義的另一套標準,不是單純評量分數。
獲得該分類的問題是「The Core in Approval-Based Committee Elections」。Epoch AI將GPT-6 Astra列為首個解決該問題的模型,但解決方式標示為「human + AI」。
Becker、Greger與Peters研究團隊表示,核心概念與證明主要歸功於GPT-6 Astra,但過程需要長時間互動。Epoch AI在問題頁面指出:「GPT-6 Astra並不是只靠簡單提示詞就能立即解決問題。」
這項紀錄更接近模型在人類研究人員協作過程中提出關鍵想法,而不是模型完全獨立解題。僅憑「Major Advance」分類,難以將其擴大解讀為AI單獨完成的研究成果。
問題本身也有前提條件。研究團隊的解法證明,在核准投票委員會中不存在「core為空」的案例。
Epoch AI表示,因此該基準測試問題從一開始就被設計成不可解的形式,但依照政策仍將其標示為已解決。問題的解決紀錄與題目設計是否恰當,應分開看待。
因此,「GPT-6 Astra在FrontierMath首度達成Major Advance」更接近將不同事實合併後的摘要。已確認的事實是,GPT-6 Astra在Tier 4(v2)取得97.6%,並在人類研究人員協作下,對Open Problems計畫中的Major Advance問題作出貢獻。
評估獨立性也是爭議焦點。Epoch AI在關係揭露文件中表示,FrontierMath是在OpenAI支持下開發,且OpenAI可獨家取得部分問題的存取權。
相關說明指出,OpenAI委託製作300道數學問題,並可取得問題與解法。Epoch AI表示,正準備另外建立一套由50道問題組成、OpenAI無法查看解法的題庫。
另一項評估顯示,成果範圍更為有限。GPT-6 Astra在FrontierMath Erdős的官方分數為3%,Epoch AI表示,在固定條件下,模型只解決了68題中的2題。
包含重複嘗試與更大預算的非官方實驗中,模型解決了5題,但該結果未納入官方分數。這顯示,模型表現可能因FrontierMath的細分題組與評估條件不同而大幅變化。
這次結果顯示,AI數學推理能力的基準測試數據,難以與實際研究成果視為同一件事。本次資料未提出其與虛擬資產、區塊鏈市場的直接關聯,也未提及相關代幣的受惠可能性。
留言 0