Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

GPT-5.6在26個漏洞測試中抓出23個 辨識率達88.5%居冠

顯示漏洞掃描畫面的筆記型電腦 / TokenPost.ai

阿里巴巴(Alibaba,BABA)通義千問(Qwen)3.8-Max在漏洞偵測測試中展現成本優勢的消息傳出,不過負責測試的資安業者Aikido公開的報告裡,其實並未列出這個模型的結果。

中國區塊鏈媒體BlockBeats於5日報導,Qwen3.8-Max在三次漏洞偵測測試中表現與其他競爭模型相近,總花費為821美元(約新台幣2.6萬元),僅為Claude Opus 5與GPT-5.6 Sol的一半左右。

Aikido於7月16日公布、27日更新的基準測試中,針對GitHub Advisory Database(GitHub安全通報資料庫)登錄的26個CVE漏洞,讓13個AI模型各執行三次。受測名單涵蓋OpenAI的GPT-5.4、GPT-5.5、GPT-5.6系列,以及Anthropic的Claude Haiku、Claude Opus系列。

xAI的Grok-4.5、Google的Gemini系列,還有開放權重模型GLM-5.2也名列受測對象,但Qwen3.8-Max並未出現在Aikido公開的模型清單中。

公開結果顯示,GPT-5.6在26個CVE中重新找出23個,「重現率」達88.5%,成績最佳。Claude Opus系列找出15至18個,Grok-4.5則找出20個。

7月19日追加測試的Kimi K3同樣找出23個,與GPT-5.6並列最高分。Aikido指出,Kimi K3的測試成本比GPT-5.6-Sol便宜4倍。

這次測試並非以一般聊天機器人問答的方式進行。Aikido讓每個模型在專為AI探索實際程式碼庫、追蹤可疑流程而設計的程式碼分析框架中運作。

評估方式採用「pass@3」,也就是同一模型執行三次,只要有一次找出漏洞就列入計算。由於每次執行遺漏的漏洞可能不同,這種方式看的是重複執行後的偵測涵蓋範圍,而非單次結果。

反覆執行也代表模型呼叫成本會直接影響整體稽核花費。這正是為什麼比較AI模型表現時,除了單次效能,還得一併考量執行次數、框架設計,以及篩選誤判與遺漏的驗證流程。

Qwen Code官方文件說明,qwen3.8-max指的是qwen3.8-max-preview版本。SiliconANGLE於7月19日報導,此前公布的Qwen3.8-Max總參數量雖達2.4兆個,但實際啟用參數數量與授權條件仍未公開。

Aikido的基準測試以一般軟體已知的CVE漏洞為對象,並未另外測試智能合約、交易所基礎設施與錢包安全漏洞,因此這次數據較難直接解讀為區塊鏈資安稽核的表現。

區塊鏈領域近來持續嘗試將AI導入實際程式碼檢測。此前也曾公開針對150個比特幣程式碼庫進行的AI安全檢測,以及以太坊共識用戶端的漏洞偵測案例。這些案例同樣顯示,區分AI提出的候選項究竟是真實漏洞還是誤判,才是驗證流程的關鍵。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1