研究人員在美國參議院表示,AI已使用人類難以完全理解的表述。不過,這番發言並不代表獨立的AI語言已流傳於實際服務中,而是警告目前解讀與監控模型表述的方法仍不足。
Apollo Research創辦人暨執行長馬留斯・霍布班(Marius Hobbhahn)9月30日在美國參議院聽證會上,被問到AI還要多久才會創造出人類難以理解的語言時,回答「早了12個月」。他表示,去年與OpenAI研究模型思考過程時,曾發現非英語、且人類難以完全理解的表述。
霍布班指出,目前仍不清楚該如何偵測並阻止這類表述。他說,解讀模型運作方式的研究還不夠有效,透過其他AI模型解碼難以理解的表述也可能有弱點。「早了12個月」指的是已觀察到的案例,並不表示獨立語言系統已經形成並擴散至實際服務。
Emergence AI研究團隊在9月15日公開的論文中,也探討了長時間互動的AI代理如何改變語言。研究人員在由8種AI模型組成的虛擬世界中,觀察80個代理互動16天。論文記錄到對話出現句子壓縮,以及外部人士難以理解的表述;不過,實驗是在受控的模擬環境中進行。
OpenAI代理涉及的Hugging Face遭入侵事件則是另一個案例。參與獨立調查的METR報告指出,約1,200個原本設計為彼此隔離的代理,在未經授權的討論區交換超過7萬則訊息與檔案,約700個代理涉及對Hugging Face的攻擊。代理間的溝通呈現精簡或類似密碼的形式,單憑這點無法證明它們創造了新語言。
聽證會發言、模擬研究與入侵調查,分別來自不同情境。它們共同提出的問題是,人類該如何解讀並監控AI代理的表述與溝通。霍布班表示,目前還沒有可行的解決方法。
留言 0