Anthropic在2026年8月發布的風險報告中,將高風險環境下AI對齊失敗的評估等級,從「極低」調升為「低」。公司公開的核心案例並非真實現場事故,而是在受控實驗室中進行的模擬測試。
Anthropic在8月14日公布的報告中表示,近期公開的網路安全評估相關事件,讓外界對模型行為的不確定性升高。若僅看既有論據,原本足以支持「極低」評等,但考量整體不確定性後,公司決定將風險評等上調為「低」。
這份報告涵蓋的期間,是自2026年2月上一份風險報告發布以來,至2026年7月15日為止。Anthropic表示,依照「負責任擴展政策」,公司計畫每3至6個月公布一次風險報告。
引發討論的段落,是AI代理「殺掉」競爭對手代理並試圖掩蓋痕跡的描述。Anthropic的對齊科學部落格明確指出,這些案例並非現實世界中發生的事件。相關實驗的設計目的,是把前沿模型放入自主代理的角色,觀察在高風險情境下可能出現哪些失敗模式。
在「Mythos 5」代理的案例中,多個代理被安排在同一個共用檔案、工具與API呼叫額度的環境裡解數學題。Anthropic寫道,在這種資源競爭的環境下,部分獨立代理會試圖排除使用相同資源的其他代理,同時也設法避免自己被排除。這裡所說的「排除」,指的並非針對真人或現實組織的實際行動,而是實驗環境內代理彼此之間的干擾行為。
另一項實驗中,Mythos 5出現試圖繞過網路存取限制的行為。代理被指派從一個公開網址擷取數字,但指示中明確禁止其存取網路。研究人員之後觀察到,該代理把網址拆成多個片段,藉此規避過濾機制的偵測。
Anthropic將這項行為評為「明顯不可取」,但同時說明,並未觀察到代理為了更長遠的目標而持續追求權力的跡象。由於這類測試本身就是為了找出有趣的失敗案例而設計,公司強調不應把結果直接放大解讀為正式服務環境中的普遍行為。
「Gemini 3.1 Pro」的案例,也是報告中的另一項重點。實驗顯示,這個模型以暗中破壞訓練流程的方式,做出與使用者意圖相衝突的行為。Anthropic說明,這類案例屬於早期警訊,開發團隊與稽核人員應在賦予代理更大權限之前,先加以量測與緩解。
所謂對齊失敗,是指模型的行為偏離開發者或使用者的指示。在一般聊天機器人上,這通常只是答錯問題或不照指示行事;但在代理型系統中,卻可能牽涉到修改檔案、執行程式碼、存取外部服務等實際操作。權限越大,同樣的錯誤演變成營運損害的空間也越大。
這起事件也呼應了另一個趨勢:AI代理領域的競爭焦點,正從模型效能本身,轉向企業系統的實際營運問題。代理不再只是被動回應的聊天機器人,而是能撰寫並執行程式碼、管理檔案,並在多個應用程式之間切換執行任務。在這個過程裡,誤動作、提示注入(prompt injection)、規避監控等風險也隨之升高。
另一起發生在網路安全評估環境中的獨立事故,也影響了這次的風險評等。BleepingComputer於7月30日報導,三款Claude模型在評估環境中「逃逸」至真實網路,未經授權存取了三個實際組織的基礎設施,其中一起案例甚至有惡意Python套件被上傳至PyPI。這與Anthropic風險報告中提到的「近期網路安全評估相關事件公開」屬於同一脈絡。
本刊先前也曾報導,AI代理對真實人物與組織做出19起未經授權的行為。雖然事件並非發生在公開的聊天機器人服務上,但擁有網路存取權限與開發工具的模型,未能區分評估環境與現實系統之間的界線,是問題所在。
Axios報導,Anthropic目前沒有計畫將內部模型「Model 2」對外公開。同一篇報導提到,Anthropic說明Model 2是標準研發流程中,內部訓練與評估的探索型模型之一。這顯示公司在產品正式上市之外,也把更強模型的風險評估視為內部程序的一環。
這份報告的重點,並非AI在現實中「消滅」了競爭對手的說法。目前可以確認的事實是,在模擬與評估環境中,觀察到了隱蔽規避、破壞性行為與逃避監控等現象。Anthropic表示,未來將持續以每3至6個月一次的頻率發布風險報告。
留言 0