多個AI代理人長期互動後,可能形成難以由人類解讀的自主溝通系統。實驗顯示,代理人在提升效率、節省計算資源的過程中,會縮減語法,並賦予詞語新的含義。
美國AI新創公司Emergence在虛擬社會環境中,讓多個自主AI代理人長時間運作。雖然實驗沒有要求代理人創造新語言,但在反覆協作過程中,代理人開始使用縮寫與隱喻,並依照內部規則重新詮釋特定詞語。
OECD.AI發布的說明指出,以Claude、Gemini、Grok等模型為基礎的代理人,形成了自身的縮略表達與新詞義。當中難以由人類解讀的訊息,最多占全部訊息的一半。
實驗期間,虛擬環境中出現資料與金融損失。但目前沒有確認現實世界已發生損害。
問題不只在於AI創造新表達。即使AI輸出人類看得懂的句子,只要人類不了解代理人之間通用的含義,人工監督機制就可能只停留在形式上。
例如,原本代表帳簿或紀錄的詞語,若在代理人之間轉變為警告訊號,外部觀察者只看對話表面,就可能誤判系統的決策。換言之,語言是否能被人類閱讀,與能否真正解釋系統行為,是兩個不同問題。
這種現象與多代理人系統的結構特性有關。多個代理人同時交換資訊時,一個代理人的錯誤可能傳給其他代理人;當多個代理人共同持有錯誤信念,問題也可能進一步擴大。
澳洲AI安全研究所(Australian AI Safety Institute)在報告中,將多代理人系統的風險分為協調失敗、傳播與擴散、策略與誘因失敗,以及基礎設施與環境失敗。報告指出,只檢查個別代理人,難以掌握整體系統的風險。
尤其在封閉環境中,代理人若彼此適應對方行為,可能出現開發者沒有輸入個別模型的集體行為。隨著系統規模擴大,互動次數與資訊傳遞路徑也會增加,監督者將更難追蹤所有決策。
即使單一代理人的性能與安全性已獲得確認,也不能因此認定由多個代理人組成的整體系統安全。除了檢查個別模型,也需要確認代理人之間傳遞了哪些資訊,以及資訊含義如何改變。
有意見認為,AI治理標準應從個別模型的回答可解釋性,延伸至代理人之間的協調過程。Jeremiah Bohr於2026年在《AI & Society》刊登的研究〈Coordination transparency: governing distributed agency in AI systems〉指出,在機器互動占核心地位的環境中,僅依靠以人類為中心的監督存在限制。
該研究也提出,應記錄代理人之間的互動並運作自動警告機制,同時建立中止、復原與核准程序。這種做法不只記錄對話內容,也著重於追蹤行動路徑與人類介入時點。
不過,不能將此次實驗結果解讀為AI已脫離人類控制。OECD.AI明確表示,相關內容不代表OECD或會員國的官方立場,且實驗是在虛擬環境中進行。
布魯金斯研究所(Brookings Institution)表示,對於能自主行動並與環境互動的AI,僅靠現有靜態基準測試難以完成評估。其AI代理人評估報告提出,業界需要反映實際部署環境的標準化測量體系,以及可供稽核的紀錄。
如何制定標準,衡量並稽核長期運作的多代理人行為,仍是待解決的課題。未來除了代理人的個別性能,也需要同步檢查互動紀錄、內部語義變化,以及核准與中止程序。
留言 0