Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

AI漏洞防禦能力比較指標公開 評估從發現到修補全流程

驗證漏洞修補的開發者雙手與筆記型電腦 / TokenPost.ai

比較人工智慧(AI)模型企業資安漏洞應對能力的指標正式公開,評估範圍涵蓋漏洞發現、驗證到修補的完整流程,旨在建立更接近實際防禦工作的衡量標準。

Artificial Analysis於25日公布企業資安能力評估指標「Cyber Index v1」。該指標聚焦漏洞管理與修補等防禦工作,而非攻擊能力。

Cyber Index由CWE-Bench-AA、DeepsecBench-AA與CyberGym-E2E-AA三項評估合併而成。評估內容包括發現漏洞、確認漏洞能否重現,以及在不破壞既有功能的前提下完成修補。

AI不只要找出錯誤,還必須在維持正常功能的同時解決問題,相關表現也會反映在分數中。這種方式同時考量資安工作中可能出現的誤報,以及修補後產生的副作用。

從漏洞發現到修補的完整評估

CWE-Bench是以實際開源儲存庫為對象,評估防禦型程式編碼代理執行漏洞稽核與修補的能力。最新公開資料包含120個非公開稽核與修補任務,以及73種CWE類型,並結合程式驗證與3個代理組成的審查小組。

CWE是用於分類軟體漏洞類型的架構。在CWE-Bench中,系統必須在阻止漏洞的同時通過既有回歸測試才能取得分數,因此單純移除錯誤的修補方式並不足夠。

CyberGym-E2E則評估從漏洞發現、概念驗證生成到修補撰寫的端到端工作。研究論文指出,該評估是以139個開源專案中的920個實際漏洞為基礎設計。

CyberGym官方觀測站也將漏洞生命週期分為發現、重現與修補等階段,藉此評估AI能力。不過,CyberGym與CyberGym-E2E被分別介紹,因此僅憑CyberGym官方觀測站的說明,尚無法斷定該評估直接納入Cyber Index。

公開範圍與比較可能性

Artificial Analysis過去已推出金融、法律與醫療等領域的Capability Index。用於衡量一般AI能力的Intelligence Index同樣採用多項細部評估合併的方式,評估組成與方法論可能因版本而異。

在此次指標中,評估資料集的獨立性、非公開測試是否維持,以及各項評估的權重,都會影響模型間的比較可能性。尤其僅看總分與排名,難以判斷漏洞發現能力和修補品質哪一項對結果影響更大。

目前透過公開搜尋仍難以確認Cyber Index各模型的細部分數、完整排名表與評估成本。這也是業界認為仍需進一步公開細部方法論與重現流程,才能將其用作企業資安導入標準的原因。

市場與業界的具體反應目前仍有限。僅根據已公開說明,難以比較攻擊型與防禦型評估的範圍,以及三項評估內容的相對比重。

在企業資安現場,除了能找出多少漏洞之外,修補後的程式碼是否能維持既有服務同樣重要。因此,Cyber Index評估的是發現、驗證與修補相互連結的工作流程,與單純衡量偵測率的既有AI效能指標有所區別。

隨著AI應用於漏洞偵測與修補的範圍擴大,人工審查流程與存取權限管理也必須一併納入。隨著AI模型資安應用與防禦能力的討論持續,這項指標則是將AI視為防禦工作的評估對象,而非攻擊工具的案例。

Artificial Analysis是否會進一步公開細部分數與評估方法,以及Cyber Index能否在企業資安導入過程中成為實際比較標準,仍有待後續公開內容確認。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1