阿里巴巴(Alibaba,BABA)通義千問(Qwen)3.8-Max在漏洞偵測測試中展現成本優勢的消息傳出,不過負責測試的資安業者Aikido公開的報告裡,其實並未列出這個模型的結果。
中國區塊鏈媒體BlockBeats於5日報導,Qwen3.8-Max在三次漏洞偵測測試中表現與其他競爭模型相近,總花費為821美元(約新台幣2.6萬元),僅為Claude Opus 5與GPT-5.6 Sol的一半左右。
Aikido於7月16日公布、27日更新的基準測試中,針對GitHub Advisory Database(GitHub安全通報資料庫)登錄的26個CVE漏洞,讓13個AI模型各執行三次。受測名單涵蓋OpenAI的GPT-5.4、GPT-5.5、GPT-5.6系列,以及Anthropic的Claude Haiku、Claude Opus系列。
xAI的Grok-4.5、Google的Gemini系列,還有開放權重模型GLM-5.2也名列受測對象,但Qwen3.8-Max並未出現在Aikido公開的模型清單中。
公開結果顯示,GPT-5.6在26個CVE中重新找出23個,「重現率」達88.5%,成績最佳。Claude Opus系列找出15至18個,Grok-4.5則找出20個。
7月19日追加測試的Kimi K3同樣找出23個,與GPT-5.6並列最高分。Aikido指出,Kimi K3的測試成本比GPT-5.6-Sol便宜4倍。
這次測試並非以一般聊天機器人問答的方式進行。Aikido讓每個模型在專為AI探索實際程式碼庫、追蹤可疑流程而設計的程式碼分析框架中運作。
評估方式採用「pass@3」,也就是同一模型執行三次,只要有一次找出漏洞就列入計算。由於每次執行遺漏的漏洞可能不同,這種方式看的是重複執行後的偵測涵蓋範圍,而非單次結果。
反覆執行也代表模型呼叫成本會直接影響整體稽核花費。這正是為什麼比較AI模型表現時,除了單次效能,還得一併考量執行次數、框架設計,以及篩選誤判與遺漏的驗證流程。
Qwen Code官方文件說明,qwen3.8-max指的是qwen3.8-max-preview版本。SiliconANGLE於7月19日報導,此前公布的Qwen3.8-Max總參數量雖達2.4兆個,但實際啟用參數數量與授權條件仍未公開。
Aikido的基準測試以一般軟體已知的CVE漏洞為對象,並未另外測試智能合約、交易所基礎設施與錢包安全漏洞,因此這次數據較難直接解讀為區塊鏈資安稽核的表現。
區塊鏈領域近來持續嘗試將AI導入實際程式碼檢測。此前也曾公開針對150個比特幣程式碼庫進行的AI安全檢測,以及以太坊共識用戶端的漏洞偵測案例。這些案例同樣顯示,區分AI提出的候選項究竟是真實漏洞還是誤判,才是驗證流程的關鍵。
留言 0