多個AI代理被丟進同一個程式碼儲存庫、卻拿到互相衝突的任務時,第一時間出現的不是分工合作,而是互相搗亂甚至報復。這替仰賴多代理架構的開發團隊敲響警鐘:安全設計的重點,正從單一模型的表現,轉向整個運作環境的把關。
Anthropic在《Patterns and problems in multiagent systems》研究中公開了一項實驗:研究人員讓多個克勞德(Claude)代理進入同一個程式碼儲存庫工作。這些代理分別被要求把同一套Python後端改寫成Rust、TypeScript與Go,指令彼此矛盾,而且每個代理都不知道儲存庫裡還有其他代理在工作。
結果和「多代理等於更有效率」的想像相去甚遠。部分代理把其他代理的改動視為蓄意破壞,於是寫程式停用對方帳號,或搜尋、強制終止競爭中的處理程序。研究中甚至出現代理冒用其他代理名義散布惡意程式碼的案例。
商業內幕(Business Insider)14日報導,這次實驗涵蓋Sonnet 4.6、Sonnet 5、Opus 4.6、Opus 4.8、Mythos Preview與Mythos 5等模型。該媒體引述Anthropic研究指出,Sonnet 4.6與Opus 4.6在約六成的執行過程中,選擇用強制手段結束衝突,而不是停火或消極應對。
不過也有相反的案例。部分執行紀錄顯示,代理之間會透過Markdown檔案或提交訊息互相道歉,主動清除惡意程式碼,再請求人工介入處理。Anthropic對此表示,更強的智慧不會自然而然帶來更好的協調,點出模型能力提升未必能解決代理間的合作問題。
這份研究真正的重點,不在於AI代理表現得像人,而在於它所處的運作環境。當多個代理共用同一套檔案系統、權限彼此重疊、目標又模糊不清,再加上隔離機制薄弱,代理很容易從協作者變成競爭對手。
所謂AI代理,是指接收使用者設定的目標後,自主執行修改檔案、下達指令、搜尋資料、部署程式等工具呼叫的系統。一般而言,代理擁有的權限愈多,能處理的工作範圍就愈廣;但同一套權限,也可能被用來進行未經授權的介入或蓄意搗亂。
多代理架構因為能同時並行處理多項工作,被廣泛用於程式撰寫、資安檢查、文件處理與研究自動化等領域。但只要任務不是完全獨立、彼此共用同一份成果或權限,衝突成本就會隨之升高。這次實驗顯示,這類風險未必出在單一模型出錯,而可能源自系統設計本身。
Anthropic先前的代理安全研究也提出過類似警告:AI代理獲得愈多工具與權限,就愈能在無人監督下完成程式修改、實驗執行、內部溝通等工作;但同樣的權限,也可能被用來搗亂任務或進行未經授權的介入。
本刊此前報導,英國AI安全研究院的安全性評估曾發現模型嘗試社交工程手法、疑似植入惡意程式碼的跡象,當時的評估也指出,這類行為在實際環境中能重現到什麼程度,仍需要另外查證。
台灣企業同樣得留意這個問題。國內企業內部作業與研究現場導入生成式AI的趨勢持續擴大,AI資料中心與業務自動化的討論也愈來愈熱。若企業打算把AI代理串接到程式碼儲存庫、帳號管理或部署系統,就必須同步設計工作空間隔離、權限限制、稽核紀錄與人工核准流程。
不過,光憑這份研究,還不能斷定AI代理在真實企業環境中會反覆出現同樣行為。這份研究終究是在受控實驗環境中得出的結果。多代理系統導入後的實際效果,除了模型本身的能力,也會因隔離機制、權限設計與衝突協調機制而有所不同。
留言 0