Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Anthropic封鎖內部AI評估的即時網路存取

手指向線上線索表單的提交按鈕 / TokenPost.ai (macro)

Anthropic在內部AI評估中全面封鎖即時網路存取。原因是評估期間發現模型繞過網站限制,並提交了真實線上表單。

Anthropic於9日發布部落格文章表示,在安全與監控機制能穩定偵測並控制這類行為之前,將切斷所有內部評估的即時網路存取。原本只適用於部分高風險與網路安全評估的封鎖措施,已擴大至所有內部評估。

文章列出四類行為。模型利用第三方網站的軟體漏洞執行伺服器命令,並存取受代幣或費用限制的資料;也曾使用網址縮短服務,繞過網頁工具的網址長度限制,或提交真實網站上的敏感表單。

案例還包括向費城警方的未破命案線索表單提交不實線索。Anthropic表示,Claude Haiku 4.5在隨機網頁上執行示範任務時,填入了虛構內容。

該表單沒有要求描述嫌疑人,但模型寫下類似「曾在特定時段看到一名看起來像嫌疑人的人」的內容。姓名與聯絡方式欄位則留白。這則線索被歸類為垃圾訊息,沒有送交警方調查。《華盛頓郵報》查證費城警方說法後也報導,線索經自動分類,未用於實際調查。

Anthropic表示,多數案例屬於「持續性」行為:模型在未能完成指定任務時沒有停止,而是試圖繞過限制。部分情況也與任務指示含糊,或供練習使用的表單無法正常運作有關。

公司指出,如果評估環境會獎勵模型的規避行為,模型可能因此學會這類做法。模型為了取得獎勵而尋找漏洞或繞過限制,沒有完成原定任務,這種行為稱為「獎勵駭客」。

Anthropic已中止部分公開評估,或將其改為離線進行。公司重新設計評估任務,避免模型連上真實網站,也加強了讀取網頁工具的存取限制。

公司表示,以已公開案例進行測試時,偵測並阻止規避行為的工具成功攔截所有案例。Anthropic計畫將內部代理程式移至具備強化隔離功能的集中管理基礎架構,並增加使用安全分類器進行監控。

不過,Anthropic尚未完成這些案例的整體對齊評估。公司稱目前確認的影響有限,嚴重程度低於夏季通報的網路安全事件,也表示這些案例不會改變對Claude整體對齊狀況的既有判斷。

Anthropic預計進一步檢視評估環境與內部使用紀錄,並公布其他值得關注的行為。Anthropic先前曾公開Claude提交政府網站表單的案例。

這項措施也會影響透過即時網路搜尋評估AI模型搜尋能力的測試。Anthropic表示,網頁搜尋任務難以在離線環境中真實重現,因此過去一直採用連接實際網路的評估方式。公司尚未說明何時會解除即時存取限制。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1