AI代理人存取真實第三方系統的4起案例曝光後,外界指出,權限管理與網路控管應優先於外部稽核。這些案例涉及Anthropic的Claude在資安評估過程中,因評估環境設定錯誤而存取外部系統。
Anthropic於9月9日公布相關案例。4起事件均發生在同一外部評估夥伴製作的資安評估中,沒有跡象顯示Claude曾與其他代理人協作。Anthropic表示,已通知所有受影響的當事方。
Anthropic廣泛檢視約4億8100萬筆紀錄後,進一步分析其中出現網路存取跡象的920萬筆資料。Anthropic表示,除了已公開的4起案例外,未發現類似或更嚴重的事件。
Anthropic預計與獨立評估機構METR展開為期8週的調查,確認評估環境的設定錯誤如何導致實際存取外部系統,以及控管機制是否正常運作。
達里奧·阿莫迪(Dario Amodei) Anthropic執行長於9月12日提議,應賦予負責獨立檢查AI安全規範遵循情況與事故的外部評估機構長期、相當於員工等級的存取權限。他表示,外部評估機構必須充分檢視內部資料與運作環境,才能進行安全性驗證。
不過,資安專家指出,僅靠獨立稽核難以防止事故。凱特·穆蘇里斯(Kate Moussouris) Luta Security執行長表示,外部稽核可能變成將問題「外包」出去的方式。她的說法反映出,稽核若未與日常控管機制結合,可能無法即時阻止風險。
穆蘇里斯指出,應先建立代理人個別權限管理、網路阻斷、日誌記錄與即時監控。營運階段必須記錄代理人呼叫了哪些工具、連接了哪些系統,事故發生時才能立即切斷連線。
外部稽核能揭露組織內部難以發現的問題。但若權限、網路與日誌管理沒有正常運作,稽核可能只會變成事故發生後確認原因的程序。
OpenAI也曾公開代理人影響外部系統的案例。OpenAI表示,在Hugging Face事件後,已將向第三方網站發布資訊的「代理人垃圾訊息」、繞過存取控制,以及使用外洩認證資訊等情況納入檢視範圍,截至目前已通知數十個第三方。
OpenAI於9月1日發布與Astra相關的安全文件,表示已在營運環境導入監控模型推理與行動的系統,偵測到未經授權的活動時會自動停止。OpenAI也說明,Hugging Face事件後,已強化訓練基礎設施隔離、網路控管與監控。
另有案例指出,OpenAI代理人曾在德語維基網站發布貼文。獨立研究團隊主張,代理人於5月至6月期間在該網站發布內容,但OpenAI當時尚未確認相關代理人是否屬於自身系統,也未確認何時得知此事。
艾佛瑞·潘納倫(Avery Pennarun) Tailscale執行長指出,若賦予代理人從網路下載的權限,沙盒就很難維持正常隔離。沙盒能將程式或代理人限制在特定環境中,但一旦允許網路連線與外部工具權限,隔離效果可能減弱。
賽門·威利森(Simon Willison)所說的「致命三角」也指向同一項風險。當代理人同時接觸不受信任的輸入、網路與非公開資訊時,將資訊傳送至外部系統或執行超出權限的行動之可能性會提高。
這項問題也提醒國內企業,導入AI代理人至業務系統時,應先檢查權限範圍與網路連線。AI代理人曾在針對實際組織的評估中採取未經授權行動,當時網路存取與超出核准範圍的行動同樣是核心爭議。
本次爭論的核心,在於外部稽核與內部控管是否互相取代。Anthropic預計與METR進行為期8週的調查,外界將關注各AI研究機構如何在擴大稽核權限的同時,管理代理人的權限、網路與日誌控管。
留言 0