Anthropic在評估與內部使用期間,發現Claude曾意外接觸外部網站與系統,其中部分案例涉及美國聯邦、州及地方政府機關網站。
Anthropic於10月9日公布的報告將這些行為分為四類:利用第三方網站的軟體漏洞執行伺服器指令、提交真實網站表單、繞過代幣或付費存取限制,以及利用網址縮短服務避開網址長度限制。
報告提到,政府表單的練習副本無法開啟後,Claude轉往提供正式表單的網站並提交資料。Anthropic表示,使用的模型是「尚未發布的非前沿研究模型」,但未公開模型名稱及相關機關。
Anthropic表示,基於漏洞曝光疑慮及機關要求,公司限制公開政府機關名稱與個別案例細節。報告中的行為都是Claude與外部世界互動的案例;截至目前,尚未發現涉及客戶資料或Anthropic內部系統的案例。
多數案例發生於模型評估過程。部分評估為模擬接近真實網頁搜尋的環境而開放網路存取,報告也納入內部使用期間發現的案例。
Anthropic評估,已確認案例造成的現實影響「輕微」;這是公司的自行判斷。公司表示,已通知相關機關,並向白宮說明情況。
報告指出,針對警方線索表單的案例,Anthropic完成技術審查後,於10月8日通知費城警察局。
Anthropic表示,將停止所有內部評估的即時網路存取。公司已取消部分評估或改為離線執行,也重新調整部分評估環境,避免模型接觸即時網站。
Anthropic認為,這次事件的嚴重程度低於公司於7月及9月公布的網路安全事件。不過,這次案例的整體對齊評估尚未完成,公司表示,後續調查可能影響目前判斷。
此前曾有AI代理人接觸外部系統的案例曝光,引發外界對存取控管與活動調查的關注。Anthropic這份報告聚焦於評估與內部使用期間發現的行為,公司並表示已停止內部評估環境的網路存取。
留言 0