Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Grok 4.7、Xiaomi MiMo-V2.6-Pro以56分並列網路防禦評測第一

標示漏洞修補的程式碼審查資料 / TokenPost.ai

Grok 4.7與小米(Xiaomi)MiMo-V2.6-Pro在Cyber Index評測中各得56分,並列第一。每項評測任務的成本分別為Grok 4.7的11.67美元,以及MiMo-V2.6-Pro的0.18美元。

Artificial Analysis在評測頁面將Grok 4.7的設定標示為「xhigh」。GPT-6 Luna以53分排名其後。原文標題所稱的「第一」指兩款模型並列第一。

Cyber Index評估模型在實際軟體儲存庫中尋找漏洞、重現並驗證漏洞,再修補問題且不影響既有功能的防禦能力。Artificial Analysis表示,評分由CWE-Bench-AA、DeepsecBench-AA與CyberGym-E2E-AA三項評測等權重合併計算,不包含開發攻擊性漏洞利用工具的能力。

Artificial Analysis指出,三項評測涵蓋漏洞稽核與修補、漏洞偵測,以及記憶體安全問題的發現、重現和修補等不同任務。因此,56分是多項防禦任務的綜合結果,不代表模型在特定企業的程式碼庫或安全流程中也能達到相同表現。

兩款模型的綜合分數並列領先,但每項評測任務的成本有所不同。Artificial Analysis公布的成本是該基準測試任務的平均值;實際企業環境的費用則可能因任務組成與使用量而異。

企業將AI模型導入資安工作時,除了綜合排名,也應一併檢視各項任務的評測結果與成本。本次評測未涵蓋模型與企業系統整合的便利性、營運穩定性或實際導入成效。

TokenPost先前曾報導,Grok 4.7在另一項基準測試中落後於Claude;該結果與本次防禦任務評測採用不同指標。TokenPost也曾報導,小米發布MiMo-V2.6系列並宣稱其開源模型具備相應效能。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1