Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

97.6%:GPT-6 Astra於FrontierMath Tier 4創佳績

研究人員檢視數學證明資料的手部 / TokenPost.ai (mono)

GPT-6 Astra在數學推理基準測試FrontierMath Tier 4(v2)中取得97.6%。不過,「Major Advance」並非這項分數所對應的等級,而是另一項解題計畫的成果分類。

OpenAI在官方公告中表示,GPT-6 Astra是在自有研究環境或API中接受評估後取得上述分數。同一表格顯示,GPT-5.6 Sol為83.0%,Claude Fable 5.1為87.8%。

OpenAI說明,評估環境與實際服務之間可能存在系統提示詞與工具差異,因此這項數據應解讀為特定評估條件下的結果。

FrontierMath Tier 4(v2)測試研究層級的數學問題。Epoch AI表示,完整題庫共有338題,其中295題屬於Tiers 1至3,43題屬於Tier 4。

Epoch AI表示,2026年6月12日修正題目錯誤時,修改了全體題目的42%。由於題庫曾經調整,比較評估結果時必須一併確認版本與題目組成。

「Major Advance」不是Tier 4的分數區間,而是Epoch AI另一項計畫「FrontierMath: Open Problems」用來評估數學成果重要性的分類,層級低於「Breakthrough」。

Epoch AI將「廣泛數學領域的研究人員會關注成果,並試圖理解解法概要」的結果定義為「Major Advance」。換言之,這是評估解題學術意義的另一套標準,不是單純評量分數。

獲得該分類的問題是「The Core in Approval-Based Committee Elections」。Epoch AI將GPT-6 Astra列為首個解決該問題的模型,但解決方式標示為「human + AI」。

Becker、Greger與Peters研究團隊表示,核心概念與證明主要歸功於GPT-6 Astra,但過程需要長時間互動。Epoch AI在問題頁面指出:「GPT-6 Astra並不是只靠簡單提示詞就能立即解決問題。」

這項紀錄更接近模型在人類研究人員協作過程中提出關鍵想法,而不是模型完全獨立解題。僅憑「Major Advance」分類,難以將其擴大解讀為AI單獨完成的研究成果。

問題本身也有前提條件。研究團隊的解法證明,在核准投票委員會中不存在「core為空」的案例。

Epoch AI表示,因此該基準測試問題從一開始就被設計成不可解的形式,但依照政策仍將其標示為已解決。問題的解決紀錄與題目設計是否恰當,應分開看待。

因此,「GPT-6 Astra在FrontierMath首度達成Major Advance」更接近將不同事實合併後的摘要。已確認的事實是,GPT-6 Astra在Tier 4(v2)取得97.6%,並在人類研究人員協作下,對Open Problems計畫中的Major Advance問題作出貢獻。

評估獨立性也是爭議焦點。Epoch AI在關係揭露文件中表示,FrontierMath是在OpenAI支持下開發,且OpenAI可獨家取得部分問題的存取權。

相關說明指出,OpenAI委託製作300道數學問題,並可取得問題與解法。Epoch AI表示,正準備另外建立一套由50道問題組成、OpenAI無法查看解法的題庫。

另一項評估顯示,成果範圍更為有限。GPT-6 Astra在FrontierMath Erdős的官方分數為3%,Epoch AI表示,在固定條件下,模型只解決了68題中的2題。

包含重複嘗試與更大預算的非官方實驗中,模型解決了5題,但該結果未納入官方分數。這顯示,模型表現可能因FrontierMath的細分題組與評估條件不同而大幅變化。

這次結果顯示,AI數學推理能力的基準測試數據,難以與實際研究成果視為同一件事。本次資料未提出其與虛擬資產、區塊鏈市場的直接關聯,也未提及相關代幣的受惠可能性。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1