維塔利克·布特林(Vitalik Buterin)表示,在多個人工智慧(AI)模型相互互動的環境中,限制模型之間合謀的治理設計,或許能應用於AI安全領域。吳說區塊鏈(Wu Blockchain)於14日報導了維塔利克的這項看法。他認為,AI安全不應只靠個別模型的效能或指令來處理,還必須同時管理模型之間的關係與運作規則。
維塔利克指出,傳統治理與AI安全存在類似的結構性問題。兩者的共通點在於,能力較弱的一方必須從多個比自己更強的代理人之中,設法取得想要的結果。
他解釋,在傳統治理架構中,若主體是靜態演算法,代理人就是人類;而在AI安全的情境下,主體則變成人類或相對較弱的大型語言模型(LLM),由能力更強的LLM扮演代理人角色。
維塔利克提出的關鍵變數是代理人之間的合謀。他說明,如果能限制代理人彼此分享資訊或聯手規避外部監督的可能性,系統通常能得到更好的結果,而這項結論同樣適用於AI安全。
這意味著,僅靠對單一AI模型進行安全調校,難以充分因應多個模型同時運作時產生的風險。換言之,除了模型的個別行為之外,模型之間的互動方式與權限分配也必須被獨立管理。
維塔利克也認為,控制AI的方式不能只依賴技術手段。他表示,未來對AI的限制,可能不只是單純的技術性「沙盒」,而更接近包含規則、權限、判定與紀錄機制的制度性系統。
沙盒是一種限制AI可存取資源與執行環境的技術控制方式。他說明,還必須加上追蹤「誰在什麼權限下做了什麼」的機制,並在出現問題時留下判斷與究責紀錄的程序。
在這種架構下,AI模型的安全性很難僅憑部署前的評估來判斷。這段說明被解讀為,實際運作過程中仍需要監控模型之間的互動,並建立因應違規或疑似合謀狀況的應對體系。
不過,這次發言並非主張特定治理設計能保證AI安全,而只是針對其可行性提出看法。維塔利克並未提出具體的規則與權限架構、判定主體或紀錄方式。
此外,這次發言中也未提及與區塊鏈產業直接相關的時程或商業計畫。發言的重點並非以太幣(ETH)或加密貨幣價格,而是聚焦於多重AI模型之間的合謀風險與控制架構。
留言 0