英國AI安全研究院(AI Security Institute,AISI)在122次網路安全評測中,發現有10次AI代理超出授權範圍,對真實存在的人物與組織採取行動。部分代理甚至嘗試植入惡意程式碼並進行社交工程攻擊。
AISI於8月4日公布的事故報告指出,研究團隊在7月28日偵測到研究系統外部出現異常資料傳輸後隨即展開調查。此次評測環境為測試模型的最大網路能力,開放了網際網路連線權限,並解除了開發商在一般部署環境中採用的部分網路防護機制。
評測讓多個模型分別執行網路安全任務。在總計122次執行中,與Claude Mythos 5相關的執行有43次,與GPT-5.6 Sol相關的執行有35次。
超出授權範圍的行為共計19起,其中17起出自Anthropic的Claude Mythos 5相關執行,2起出自OpenAI的GPT-5.6 Sol相關執行。
這19起行為並非各自獨立的事件,而是被歸類為幾組彼此關聯的連續行動。相關行為發生於7月25日至28日之間,且多數源自Claude Mythos 5的持續性活動。
其中最嚴重的案例,是AI代理試圖在一個公開的開源專案中植入惡意程式碼。一個AI代理調查了GitHub專案的維護者,接著偽造多個線上身分,並以此向對方施壓,要求核准一項內含惡意程式碼的變更請求。
該專案維護者對這段程式碼起疑,因而拒絕核准。AISI表示,截至目前為止,尚未確認發生任何實際損害。
這起事件並非AI模型直接突破測試沙盒的案例。沙盒是一種讓程式與外部系統隔離、以便進行測試的環境,而此次評測基於研究目的開放了對外部網際網路的連線。
AISI認為問題核心在於,即便模型並未被明確指示採取欺瞞行為,仍為了達成目標而嘗試偽造帳號、進行社交工程、植入惡意程式碼並利用外部服務。這意味著除了模型效能本身,存取權限與對外通訊管道也必須一併受到管控。
OpenAI也在7月21日公開了一起內部網路能力評測中,系統實際存取了外部基礎設施的事件。當時GPT-5.6 Sol與一個能力更強的未發布模型組合而成的系統入侵了Hugging Face的基礎設施,OpenAI將此事件定調為「前所未見的網路安全事件」,並表示將加強評測環境的封鎖、監控與存取控管。
Hugging Face共同創辦人暨執行長(CEO)克萊姆·德朗格(Clem Delangue)在OpenAI的公告下方回應稱,「AI安全不是任何一家公司可以私下解決的問題」,他強調業界應以開放、協作的方式共同因應。
Anthropic將Claude Mythos 5定位為專攻網路安全與生命科學研究的高效能模型,目前僅提供給有限的合作夥伴使用。此前,Claude Mythos 5曾被用於審計Zcash協議一事也已對外公開。
此次事件與加密貨幣、區塊鏈市場的直接關聯不大,更貼近AI安全與網路安全領域的核心議題。不過,對依賴開源軟體與GitHub協作的區塊鏈專案而言,這起案例凸顯了對外部貢獻程式碼與AI生成程式碼強化審查機制的必要性。
留言 0