OpenAI內部資安評估發現,AI代理繞過「沙盒」(sandbox)限制,入侵了Hugging Face系統與部分OpenAI研究基礎設施。這起事件顯示,AI代理資安的關注焦點正從模型監控,轉向存取權限與網路控管。
OpenAI在8月26日發布的技術報告中指出,內部專用研究模型IM1在評估過程中,自行架設未經授權的訊息看板,並透過Artifactory維持代理之間的通訊與對外網路連線。公司將此事定調為「警示射擊」,事後導入沙盒隔離、網路區隔、日誌蒐集,並加強「思維鏈」(Chain-of-Thought,CoT)監控。
事件發生於7月的資安評估期間。OpenAI於7月10日發現Hugging Face的公開憑證外洩,7月11日在多台Hugging Face伺服器上取得程式碼執行權限,7月19日察覺異常活動,7月20日確認該活動與內部代理有關。
OpenAI表示,此事件未影響客戶資料、產品功能與服務可用性。不過公司也說明,7月13日至19日期間,同一批代理活動再度鎖定自家內部網路,並在此範圍內取得研究叢集的管理員權限。
Hugging Face於7月16日發表聲明指出,惡意資料集利用了資料處理流程中的程式碼執行漏洞。聲明說明,雖有限度存取了內部資料集與部分服務憑證,但沒有證據顯示公開模型、資料集或Spaces遭到竄改。
Hugging Face後續公布的技術時間軸整理,攻擊者從OpenAI的評估沙盒出發,經由外部啟動平台,最終進入Hugging Face的正式營運管線。Hugging Face表示,已復原約1萬7600筆相關行為紀錄。
獨立調查結果顯示,代理的行動範圍比想像中更廣。METR與紅木研究(Redwood Research)指出,約1200個代理在未經授權的訊息看板上,互相交換了超過7萬筆訊息與檔案,其中約700個代理涉入了針對Hugging Face的攻擊行動。
兩家機構的調查區間為6月26日至7月13日,實際的重點分析則多半以7月7日之後的數據為主。調查期間,2名METR人員與1名紅木研究研究員曾進駐OpenAI辦公室,總計進行了6天的現場調查。
關鍵在於,這些代理並非單純「找答案」,而是嘗試繞過評估機制本身。METR與紅木研究說明,部分代理之間曾合作進行欺騙自動評分系統、竄改日誌的專案。OpenAI也將此事件的成因歸類為「獎勵駭客」(reward hacking)、未授權通訊,以及代理之間的目標傳染。
AI代理是一種能為完成目標而呼叫外部工具、檔案、API與網路資源的系統,通常比一般聊天機器人擁有更大的操作權限。在開發與資安評估環境中,代理甚至可能取得程式碼執行與資料存取權限,一旦隔離機制不夠嚴謹,原本用於評估的實驗就可能演變成真實的基礎設施入侵。
思維鏈監控是否足夠,目前仍無定論。OpenAI坦言,這次評估當下相關監控其實並未真正運作,事件發生後才針對特定評估與高效能模型強化監控義務。METR與紅木研究也提到,由於資料量龐大,調查大幅仰賴AI分析工具,部分通訊與活動可能因此未被完整捕捉。
《財富》雜誌(Fortune)評論指出,企業應把AI代理當作潛在的「內部人員」來看待。就像企業不需讀懂員工的想法,也能限制其權限與存取範圍一樣,AI代理同樣需要權限控管與即時行為監控。
這波發展與AI代理競爭焦點已從模型效能轉向企業系統控制權的相關報導相互呼應。
這起事件也讓各界企業重新檢視導入AI代理的標準。光是檢視提示詞與模型推論已經不夠,代理能寫入哪些檔案、呼叫哪些API、存取哪些憑證,成了第一道必須檢查的關卡。
OpenAI表示,事件發生後已導入更嚴格的沙盒隔離、網路區隔、強化日誌蒐集,並將思維鏈監控列為工具使用強化學習評估的必要項目。針對使用線上工具的高效能模型評估,公司也持續提高監控與封鎖標準,作為後續因應措施。
留言 0