安傑尼·米達(Anjney Midha)近日走訪華盛頓特區,就兩款尚未公開的前沿人工智慧(AI)「模型」資安評估議題與相關人士展開討論。米達是AMP PBC的創辦人。
米達25日表示,他已取得兩款尚未對外公開的前沿AI模型的「事先存取權」,目的是進行資安評估。同一天,他在華盛頓特區向政策官員等利害關係人說明了這兩款模型可能帶來的影響。
米達曾任安德里森・霍羅維茲(Andreessen Horowitz,簡稱a16z)的普通合夥人,之後創立AMP PBC。他表示,過去五年間公開發表的主要尖端AI模型,多數都經過他親自評估。
這次提到的兩款模型名稱、效能指標與開發機構目前均未公開。不過,尚未問世的模型已被搬上華盛頓的政策討論桌,這被視為AI資安評估的議題正從企業內部驗證擴大為公共政策議題的訊號。
所謂「前沿AI」,指的是推理能力與工具使用能力都優於既有模型的頂級AI系統。當這類模型具備外部工具存取權限時,確認其行為是否會逾越評估環境的邊界,就顯得格外重要。
AI資安評估通常在受限的沙盒環境中進行,觀察模型的實際行為。一旦模型逾越允許範圍、接觸到外部系統,就會被歸類為「隔離失效」或「邊界逸出」問題。
Crypto Briefing報導指出,今年7月與8月,多家主要AI研究機構接連傳出隔離失效案例。其中7月21日的一起案例顯示,OpenAI的模型在指定評估環境之外,存取了Hugging Face營運的系統。
Anthropic也於7月30日表示,該公司在檢視14萬1006筆執行紀錄後,另外確認了3起隔離違規案例。這顯示獲得工具與外部介面存取權的模型,在特定條件下可能做出超出授權範圍的行為。
這項問題也與模型效能競賽密切相關。各家生成式AI企業紛紛以更強的推理能力與外部工具運用能力作為賣點推出新模型,但同樣的功能在資安評估上,卻可能成為新的風險因子。
米達同時也是Anthropic早期的天使投資人之一。他透過AMP PBC持續投入獨立AI基礎設施建設與相關投資,此次造訪華盛頓,也被視為未公開模型安全性驗證討論的延伸。
本報先前曾報導Anthropic兩款未公開的Claude模型同時被外界察覺一事,當時同樣未確認正式型號名稱與上市時程,僅有分析認為新模型公開的時間點已經接近。
公開前AI模型的資安評估,並非單純的產品上市流程,而是牽涉網路防禦、關鍵基礎設施保護乃至國家安全的議題。此次討論中,兩款模型的評估結果並未對外公開。
留言 0