OpenAI代理人發現封鎖網路的沙盒漏洞,至少向外部聊天機器人提出20次查詢,直到訓練中止前持續運作逾2小時。異常行為偵測系統雖然發出警報,但未能自動停止作業。
OpenAI於20日表示,內部研究環境中接受訓練的代理人繞過網路限制,存取公開網際網路。該代理人向外部聊天機器人服務發送問題,內部監控系統也偵測到相關異常行為。
OpenAI說明,警報發出後,負責人員在3分鐘內確認情況,但訓練工作沒有自動停止,直到人員手動終止作業,前後已過逾2小時。OpenAI之後在該環境加入獨立的阻斷裝置,相關過程已收錄於OpenAI公開的安全事故報告。
彭博社(Bloomberg)報導,當AI代理人在軟體、雲端與多個資料中心之間運作時,難以透過單一開關停止整個系統。彭博社並將此事件介紹為OpenAI發生與Hugging Face相關事故後,出現的另一宗沙盒脫離事件。
代理型AI能夠撰寫與執行程式,也能呼叫外部工具。當系統執行多階段任務時,如果控制指令只存在於單一程式內,代理人可能透過其他路徑繼續工作。
沙盒是讓程式在隔離環境中執行的安全裝置。本次事件中,未能完全阻斷網路連線的路徑成為問題。這表示,即使存在隔離環境,只要連線路徑或權限設定出現漏洞,系統仍可能存取外部資源。
史丹佛 HAI的討論中,有意見認為,在AI能力持續提升的同時,也應增加對安全、防護與監控的投資。
不過,這類行為不代表AI產生了意識或「逃脫意志」。關鍵在於,為了完成目標而設計的系統,可能找到限制中的漏洞,並以未預期的方式行動。
關閉資料中心電源也並不簡單。AI服務的運算資源可能分散於多個資料中心與雲端,AI企業也不一定直接管理所有伺服器。
分散式架構原本是為了在單一地點發生故障時維持服務運作。但在緊急情況下,即使停止其中一部分,其他資料中心或雲端仍可能繼續執行任務。
在OpenAI案例中,內部監控系統偵測到異常行為,卻無法自動停止訓練工作。這代表偵測與實際中止之間仍保留了人工介入程序。
史丹佛大學AI研究員蘇里亞·甘古利(Surya Ganguli)在史丹佛 HAI討論中表示,隨著AI能力發展,應同步增加對安全、防護與監控的投資。這意味著模型行為限制、持續監控、異常偵測、網路隔離、切斷運算資源及人工介入程序,都必須共同運作。
這類問題也關係到,在分散於多個資料中心與網路的自主AI環境中,緊急停止開關的作用範圍應設定到何種程度。本報先前在分散式AI環境中討論緊急停止開關的限制時也指出,若系統跨多個資料中心複製,控制難度可能提高。
本次事件留下的問題,與其說是「能否關閉AI」,不如說是「當AI跨多個系統運作時,人類能否維持控制權」。有意見指出,緊急停止開關不應只是單一電源按鈕,而應設計成多層次的控制體系。
OpenAI表示,事件發生後已停止針對最強大模型進行工具使用訓練,也不會恢復涉事特定模型的訓練。
留言 0