Grok 4.7與小米(Xiaomi)MiMo-V2.6-Pro在Cyber Index評測中各得56分,並列第一。每項評測任務的成本分別為Grok 4.7的11.67美元,以及MiMo-V2.6-Pro的0.18美元。
Artificial Analysis在評測頁面將Grok 4.7的設定標示為「xhigh」。GPT-6 Luna以53分排名其後。原文標題所稱的「第一」指兩款模型並列第一。
Cyber Index評估模型在實際軟體儲存庫中尋找漏洞、重現並驗證漏洞,再修補問題且不影響既有功能的防禦能力。Artificial Analysis表示,評分由CWE-Bench-AA、DeepsecBench-AA與CyberGym-E2E-AA三項評測等權重合併計算,不包含開發攻擊性漏洞利用工具的能力。
Artificial Analysis指出,三項評測涵蓋漏洞稽核與修補、漏洞偵測,以及記憶體安全問題的發現、重現和修補等不同任務。因此,56分是多項防禦任務的綜合結果,不代表模型在特定企業的程式碼庫或安全流程中也能達到相同表現。
兩款模型的綜合分數並列領先,但每項評測任務的成本有所不同。Artificial Analysis公布的成本是該基準測試任務的平均值;實際企業環境的費用則可能因任務組成與使用量而異。
企業將AI模型導入資安工作時,除了綜合排名,也應一併檢視各項任務的評測結果與成本。本次評測未涵蓋模型與企業系統整合的便利性、營運穩定性或實際導入成效。
TokenPost先前曾報導,Grok 4.7在另一項基準測試中落後於Claude;該結果與本次防禦任務評測採用不同指標。TokenPost也曾報導,小米發布MiMo-V2.6系列並宣稱其開源模型具備相應效能。
留言 0