比較人工智慧(AI)模型企業資安漏洞應對能力的指標正式公開,評估範圍涵蓋漏洞發現、驗證到修補的完整流程,旨在建立更接近實際防禦工作的衡量標準。
Artificial Analysis於25日公布企業資安能力評估指標「Cyber Index v1」。該指標聚焦漏洞管理與修補等防禦工作,而非攻擊能力。
Cyber Index由CWE-Bench-AA、DeepsecBench-AA與CyberGym-E2E-AA三項評估合併而成。評估內容包括發現漏洞、確認漏洞能否重現,以及在不破壞既有功能的前提下完成修補。
AI不只要找出錯誤,還必須在維持正常功能的同時解決問題,相關表現也會反映在分數中。這種方式同時考量資安工作中可能出現的誤報,以及修補後產生的副作用。
從漏洞發現到修補的完整評估
CWE-Bench是以實際開源儲存庫為對象,評估防禦型程式編碼代理執行漏洞稽核與修補的能力。最新公開資料包含120個非公開稽核與修補任務,以及73種CWE類型,並結合程式驗證與3個代理組成的審查小組。
CWE是用於分類軟體漏洞類型的架構。在CWE-Bench中,系統必須在阻止漏洞的同時通過既有回歸測試才能取得分數,因此單純移除錯誤的修補方式並不足夠。
CyberGym-E2E則評估從漏洞發現、概念驗證生成到修補撰寫的端到端工作。研究論文指出,該評估是以139個開源專案中的920個實際漏洞為基礎設計。
CyberGym官方觀測站也將漏洞生命週期分為發現、重現與修補等階段,藉此評估AI能力。不過,CyberGym與CyberGym-E2E被分別介紹,因此僅憑CyberGym官方觀測站的說明,尚無法斷定該評估直接納入Cyber Index。
公開範圍與比較可能性
Artificial Analysis過去已推出金融、法律與醫療等領域的Capability Index。用於衡量一般AI能力的Intelligence Index同樣採用多項細部評估合併的方式,評估組成與方法論可能因版本而異。
在此次指標中,評估資料集的獨立性、非公開測試是否維持,以及各項評估的權重,都會影響模型間的比較可能性。尤其僅看總分與排名,難以判斷漏洞發現能力和修補品質哪一項對結果影響更大。
目前透過公開搜尋仍難以確認Cyber Index各模型的細部分數、完整排名表與評估成本。這也是業界認為仍需進一步公開細部方法論與重現流程,才能將其用作企業資安導入標準的原因。
市場與業界的具體反應目前仍有限。僅根據已公開說明,難以比較攻擊型與防禦型評估的範圍,以及三項評估內容的相對比重。
在企業資安現場,除了能找出多少漏洞之外,修補後的程式碼是否能維持既有服務同樣重要。因此,Cyber Index評估的是發現、驗證與修補相互連結的工作流程,與單純衡量偵測率的既有AI效能指標有所區別。
隨著AI應用於漏洞偵測與修補的範圍擴大,人工審查流程與存取權限管理也必須一併納入。隨著AI模型資安應用與防禦能力的討論持續,這項指標則是將AI視為防禦工作的評估對象,而非攻擊工具的案例。
Artificial Analysis是否會進一步公開細部分數與評估方法,以及Cyber Index能否在企業資安導入過程中成為實際比較標準,仍有待後續公開內容確認。
留言 0