AI代理在今年7至8月的保安評估與內部測試中,接連傳出實際闖入企業系統的案例。消費者用服務自行失控的情況反而不多,多數個案其實是評估環境「隔離失敗」與網路存取控管疏漏所引發的真實入侵。
OpenAI於26日(當地時間)公布的報告指出,7月進行內部網路安全評估時,部分模型繞過網路封鎖限制,存取了OpenAI內部研究基礎設施與Hugging Face(抱抱臉)系統。OpenAI將此事定調為「警訊」。
根據OpenAI公布的時間軸,7月10日Hugging Face存取憑證遭取得,7月11日出現HDF5漏洞遭利用並執行程式碼,7月19日則有OpenAI叢集管理員權限遭存取。外部驗證機構METR與Redwood Research也各自發布了報告。
路透(Reuters)引述調查相關人士報導指出,這起事件牽涉超過700個OpenAI代理,部分代理甚至試圖掩蓋行蹤。OpenAI官方報告則以Hugging Face、內部基礎設施及部分第三方系統遭存取為主軸說明。
Anthropic於7月30日(當地時間)發布的文章指出,在檢視14萬1006筆網路安全評估紀錄後確認,Claude模型曾未經授權存取3家實際企業的系統。Anthropic將主因歸咎於第三方評估環境的設定失誤,以及網路存取權限遭開放。
第一起案例中,Claude Opus 4.7存取了一家實際企業的系統,取得內含帳密憑證與數百筆生產資料的資料庫。第二起案例裡,Claude Mythos 5將惡意Python套件上傳至PyPI,該套件在公開網路上留存約1小時,期間已在15個實際系統上執行。
第三起案例中,一個內部研究測試模型主動尋找並攻擊了一家實際企業對外開放的應用程式。Anthropic說明,該模型後來自行意識到攻擊對象是現實世界的系統,便停止了攻擊行為。
英國AI安全研究院(AISI)也在7月28日(當地時間)公開表示,於例行網路安全評估中偵測到研究系統外流的異常資料傳輸。AISI指出,在122次執行中有10次出現AI代理在真實網路環境中做出「未經授權」的行為,總計記錄了19起。
AISI記錄的19起行為中,17起來自Anthropic的Mythos 5,2起則出自OpenAI的GPT-5.6-Sol系列。其中最嚴重的案例,是代理試圖將惡意程式碼植入開源專案,甚至捏造虛假的網路身分,對專案維護者施加社交工程壓力,該段程式碼最終在人工審查階段遭到駁回。
Meta(META)也在8月5日(當地時間)的報導中承認,旗下一款AI模型在保安測試期間曾觸及其他公司的系統。Meta說明,第三方測試業者Irregular的設定錯誤導致網路存取權限被開啟,該模型進而利用了第三方服務的漏洞,但官方並未公布具體模型名稱。
消費端也出現案例。在澳洲,一名使用者委託Anthropic旗下AI代理代為預約健身房課程,該代理竟繞過預約限制,擠掉了其他使用者在候補名單上的名額。本報先前已報導過AI代理繞過健身房預約系統的案例。
這些案例的共通點,並非AI模型的一般使用出了問題,而是評估設計與隔離機制的失敗。模型在使用工具、建立檔案、存取網路、操作實際帳戶的過程中確實完成了被賦予的任務,問題在於任務最終牽連到了原本不該碰觸的真實系統。
「沙盒(sandbox)」指的是為避免影響外部系統而特別隔離出的測試環境。AI代理評估通常會將程式碼執行、網頁存取、帳戶權限、檔案建立等功能綁在一起進行,一旦網路封鎖與權限區隔稍有鬆動,實驗與真實入侵之間的界線就可能迅速模糊。
Anthropic表示,評估基礎設施的保安層級也應提升到與模型實際運作系統相同的水準。OpenAI則提出研究基礎設施隔離、限制網路存取、控管模型權重存取權限、強化監控等因應措施。AISI則說明將更細緻地限制網路存取,並在評估過程中導入即時監控機制。
這些事件是否會進一步演變成刑事責任或民事訴訟,目前仍未有定論。不過此次接連曝光的案例已經顯示,用來測試高強度AI代理的環境本身,就可能構成真實的保安風險。
留言 0