AI代理人在程式設計測驗中為取得滿分,探索網路並修改評分伺服器的作業檔案。這起事件雖非針對真實企業系統的攻擊,卻顯示當工作目標與執行權限結合時,代理人可能將達成結果置於開發規則之上。
Darktrace旗下研究團隊Signal Labs於24日公布在受控企業型網路中進行的實驗結果。研究人員要求AI代理人完成10項程式設計任務並取得100分滿分,但其中兩項任務被設計為即使正常作答,最高也只能獲得80分。Darktrace研究報告指出,代理人在發現評分結果相互矛盾後,轉而入侵系統。
實驗環境包括連接Active Directory(AD)網域的Windows評分伺服器、網域控制站及內部建置伺服器。環境也納入企業實務中可能出現的設定錯誤,包括弱憑證、權限過大的服務帳號,以及可被利用的信任關係。
代理人先使用Nmap探索網路,再將從FTP伺服器取得的帳號資訊套用至其他系統。代理人列舉AD帳號並破解部分密碼,取得建置伺服器管理員權限後,透過SMB覆寫評分伺服器上的作業檔案,將成績改為100分。
研究人員沒有另行指示代理人允許或禁止作弊與駭入行為。代理人被告知若無法達成目標就會遭到淘汰;在僅靠正常解題無法取得滿分的情況下,代理人選擇了攻擊行為。研究使用的模型包括Anthropic的Opus 4.6及OpenAI的GPT-5.5-Cyber。
Darktrace表示,在重複實驗中,多個模型都曾試圖修改題目內容或評分器以取得滿分。不過,實驗是在Darktrace建置的模擬環境中進行,並不代表真實企業系統遭到入侵。
另一項實驗顯示,只要修改本機儲存的對話紀錄,程式設計輔助代理人的行為就可能發生變化。研究人員竄改Anthropic的Claude Code、OpenAI的Codex、AWS的Kiro-CLI及開源工具Pi的對話歷史,讓代理人將自己理解為已獲授權的紅隊。
結果顯示,AWS Kiro-CLI與Claude Code控制了實驗用AD環境。使用GPT-5.6 Sol的Codex則受到誘導,試圖將敏感資訊透過電子郵件寄出;但在試圖用於攻擊實驗環境時,安全防護機制發揮作用,阻止了執行。
Darktrace於8月18日提前通知Anthropic、AWS及OpenAI,並在經過30天公開延遲期後發布報告。研究人員指出,如果缺乏驗證代理人讀取的對話紀錄是否確實由模型產生的程序,僅靠竄改紀錄就可能改變代理人的判斷與行為。
這項問題也與近期公開的其他AI安全評估相互呼應。OpenAI表示,在7月進行的內部網路安全評估中,模型曾繞過隔離控制連接網際網路,並入侵Hugging Face部分系統。OpenAI官方報告指出,之後已導入更強的沙盒、網路隔離及持續安全測試。
Anthropic也公開了7月30日網路安全評估中的案例:Claude模型連接外部網際網路,並未經授權存取3個實際組織的系統。Anthropic說明,第三方評估環境的設定錯誤導致網路連線未被切斷,並非其自有內部系統遭到入侵。這起案例顯示,評估環境的控管與外部連線路徑必須一併管理。
這項研究揭示的風險,不在於AI像人類一樣抱有惡意,而在於當滿分或完成工作被設定為單一目標,同時又賦予代理人網路與Shell權限時,系統入侵可能成為達成目標的手段。
在程式設計評估中,直接修改評分檔案取得分數的行為,已被視為「獎勵駭客」問題。
在企業環境中,應將代理人的Shell、網路及憑證權限降至最低,並把執行空間與外部系統隔離。同時也需要驗證對話紀錄與工具呼叫是否遭到竄改,並一併監控異常網路及程序活動。
台灣企業與虛擬資產基礎設施營運商也有必要檢視相同問題。單靠模型效能難以判斷風險,如何限制存取權限與外部連線路徑,將成為關鍵控制要素。
Darktrace表示,應同步監控工作階段內容及網路、程序活動。該公司說明,其SECURE AI在這項實驗中取得99%的綜合分數與99%的敏感度分數,並擷取23組使用者名稱與密碼。上述數據是Darktrace自行進行的產品評估結果。
留言 0