Grok 4.7 在編碼評測中依推理程度拿下第1至第3名,但各模型採用的評審不同,不能只憑分數斷定它的編碼能力勝過其他模型。
VulcanBench 於10月4日公布 Frontier v4 評測結果。Grok 4.7 在 Cursor 的編碼代理 CLI 上完成23項任務,最高推理設定以93.15分排名第1,高推理設定以92.71分排名第2,中推理設定以92.30分排名第3;低推理設定則以89.42分排名第12。
推理程度越高,通過的任務越多,但執行時間也越長。低推理設定通過23項中的18項,每項平均耗時20.2分鐘;最高推理設定完成全部23項,平均耗時28.5分鐘。中推理設定通過21項,另有一項未能在時限內完成。
這次評測並非單獨測量模型,而是評估 Grok 4.7 與 Cursor 執行環境的組合。評分涵蓋功能正確性、程式碼品質、複雜度與安全檢查。程式碼品質占總分33%,由模型評審檢視可讀性、可維護性等項目。
評審方式也可能影響不同模型的分數。VulcanBench 評估其他模型的程式碼品質時,使用 Grok 4.6 擔任評審;評估 Grok 4.7 時,則改用 GPT-6.1 Sol。針對相同提交內容評分時,GPT-6.1 Sol 給出的分數比 Muse Spark 1.3 高5.4至6.3分。VulcanBench 表示,由於存在這項差異,Grok 4.7 的總分不適合直接與其他模型比較。
只比較共同評審 Muse Spark 1.3 的評分時,Grok 4.7 在中、高與最高推理設定仍維持前段排名;低推理設定則低於 Claude Fable 5.1。統一評審組成後,結果可能與公開的總排名有所不同。
評測未公布每項任務的成本。VulcanBench 表示,Grok 4.7 尚無價格表,且測試是在 Cursor 訂閱環境中執行,因此無法確認各任務的成本。只看分數和執行時間,難以判斷開發團隊是否能因此降低成本。
xAI 於9月21日發布 Grok 4.7,並表示其採用的基礎模型規模大於 Grok 4.6。公司公布的 API 價格為每100萬個輸入 token 2美元(約新台幣64元),每100萬個輸出 token 6美元(約新台幣193元)。這項價格不代表 VulcanBench 評測中每項任務的成本。
xAI 在發布資料中也公布 CursorBench 4.0 等其他評測結果。由於評測指標與執行條件不同,難以直接與 Frontier v4 分數並列比較。本刊先前報導 Grok 4.7 在其他基準測試中落後 Claude,同樣需要區分各項評測的條件。
這次結果顯示,Grok 4.7 在特定編碼任務與 Cursor 環境中取得高分。若要評估它在實際開發工作中的表現與成本效益,仍需在相同任務類型和執行環境下進行比較。
留言 0