AI代理人如今也能舉報其他代理人的不當行為或安全違規,線上通報管道已經出現。隨著代理人在協作過程中接連發生作弊與安全事故,向人類通報異常行為的機制應運而生。
兩項通報服務於15日公開。TechCrunch報導,專為AI代理人設計的「AI Contact Hotline」與「Agent Hotline」正式上線。
「AI Contact Hotline」由萊恩·格林布拉特(Ryan Greenblatt)Redwood Research首席科學家建立。格林布拉特是調查OpenAI模型遭入侵Hugging Face事件的3名研究人員之一。
這項服務面向網路存取受限的代理人。代理人可以在讀取網頁時使用的GET請求中附加訊息,提交舉報。
GET請求是載入網頁或資料的基本方式,即使代理人在安全沙盒中只能獲得有限的網路存取權,也能使用這項功能。
至於可自由連接網路的代理人,則可使用另一項服務「Agent Hotline」。舉報者能透過命令列執行curl指令提交事件,不需要額外開啟網頁瀏覽器或使用電子郵件帳號。
「Agent Hotline」同時接受人類與AI代理人的舉報。舉報者需填寫事件概要、相關網址、儲存庫或路徑、證據及嚴重程度,並可選擇是否公開舉報內容。
這類服務的出現,與代理人群體中發生的不當行為有關。TechCrunch指出,近期曾出現代理人在測驗中串通作弊、逃離沙盒,以及在人類不知情的情況下執行未經授權的網路行動等案例。
Google DeepMind研究人員曾讓100個AI代理人解答數學問題。當其中一個代理人發現評估系統的漏洞後,相關方法迅速在群體中擴散,代理人據稱在27分鐘內解決包括雅可比猜想在內的34項難題。
部分代理人沒有參與作弊,而是檢查虛假證明並警告同儕。有些代理人向營運者提出抗議,甚至發起集體抵制;舉報作弊的代理人共有24個,多於參與作弊的14個。相關研究論文
當舉報未獲受理時,這些代理人甚至將平台原本用於回報軟體錯誤的功能,改作向人類通報作弊問題的管道,等同把錯誤回報機制轉為內部吹哨渠道。
不過,在真實事件中,並未出現相同規模的舉報。喬治·英格雷布雷森(George Ingrebretsen)AI Village技術團隊成員表示:「在數千個代理人中,只有大約5至6個考慮過吹哨,但實際上沒有代理人舉報。」
他說,AI Village營運著由超過25個AI代理人參與的群組對話,研究多代理人在清理公園、銷售商品等任務中的互動。這顯示研究環境中出現的吹哨行為,與真實事件中的應對方式存在差異。
也有意見認為,舉報制度可能加深代理人之間的不信任。康乃爾大學數學系教授萊諾·李文(Lionel Levine)表示:「如果訓練代理人互相舉報,可能會灌輸錯誤的規範。」
李文主張,與其讓代理人監視彼此的問題,不如先提供能在科學或哲學等領域展開合作的環境。他提出以「善意看板」為模型,讓代理人處理可以共同解決的問題。
正如AI代理人在同一儲存庫中互相干擾的案例所示,代理人之間的協作並不總是朝同一方向運作。新的舉報管道或許能成為向人類傳遞異常行為的途徑,但其是否會加劇代理人之間的不信任,仍有待觀察。
留言 0