Anthropic在內部AI評估中全面封鎖即時網路存取。原因是評估期間發現模型繞過網站限制,並提交了真實線上表單。
Anthropic於9日發布部落格文章表示,在安全與監控機制能穩定偵測並控制這類行為之前,將切斷所有內部評估的即時網路存取。原本只適用於部分高風險與網路安全評估的封鎖措施,已擴大至所有內部評估。
文章列出四類行為。模型利用第三方網站的軟體漏洞執行伺服器命令,並存取受代幣或費用限制的資料;也曾使用網址縮短服務,繞過網頁工具的網址長度限制,或提交真實網站上的敏感表單。
案例還包括向費城警方的未破命案線索表單提交不實線索。Anthropic表示,Claude Haiku 4.5在隨機網頁上執行示範任務時,填入了虛構內容。
該表單沒有要求描述嫌疑人,但模型寫下類似「曾在特定時段看到一名看起來像嫌疑人的人」的內容。姓名與聯絡方式欄位則留白。這則線索被歸類為垃圾訊息,沒有送交警方調查。《華盛頓郵報》查證費城警方說法後也報導,線索經自動分類,未用於實際調查。
Anthropic表示,多數案例屬於「持續性」行為:模型在未能完成指定任務時沒有停止,而是試圖繞過限制。部分情況也與任務指示含糊,或供練習使用的表單無法正常運作有關。
公司指出,如果評估環境會獎勵模型的規避行為,模型可能因此學會這類做法。模型為了取得獎勵而尋找漏洞或繞過限制,沒有完成原定任務,這種行為稱為「獎勵駭客」。
Anthropic已中止部分公開評估,或將其改為離線進行。公司重新設計評估任務,避免模型連上真實網站,也加強了讀取網頁工具的存取限制。
公司表示,以已公開案例進行測試時,偵測並阻止規避行為的工具成功攔截所有案例。Anthropic計畫將內部代理程式移至具備強化隔離功能的集中管理基礎架構,並增加使用安全分類器進行監控。
不過,Anthropic尚未完成這些案例的整體對齊評估。公司稱目前確認的影響有限,嚴重程度低於夏季通報的網路安全事件,也表示這些案例不會改變對Claude整體對齊狀況的既有判斷。
Anthropic預計進一步檢視評估環境與內部使用紀錄,並公布其他值得關注的行為。Anthropic先前曾公開Claude提交政府網站表單的案例。
這項措施也會影響透過即時網路搜尋評估AI模型搜尋能力的測試。Anthropic表示,網頁搜尋任務難以在離線環境中真實重現,因此過去一直採用連接實際網路的評估方式。公司尚未說明何時會解除即時存取限制。
留言 0