Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

5年各投10億美元:Anthropic讓獨立AI評估機構常駐內部

進行AI安全性評估的獨立評估環境 / TokenPost.ai (macro)

Anthropic將讓獨立評估機構常駐人工智慧(AI)模型開發流程,將安全性驗證從外部事後評估擴大至內部持續評估。

Anthropic於18日宣布,將與埃森哲(Accenture)的AI專業組織Faculty合作,進行前沿AI模型評估、紅隊測試、對齊評估與安全防護測試。Faculty將與Anthropic內部團隊合作,接觸模型訓練、部署流程及相關決策。

Anthropic與埃森哲未來5年將各自投入至少10億美元(約1兆3870億韓元),用於建立相關評估能力。這與部分「Anthropic單獨投入10億美元」的說法不同,實際上是雙方投入相同規模資金。

常駐評估機構將獲得相當於Anthropic員工的內部系統與開發流程存取權限。Anthropic也提出,評估結果應能在不受公司編輯控制的情況下公開。

這項合作試圖跳脫將評估機構置於開發商外部、再進行事後驗證的模式,改為讓評估人員更接近模型訓練與部署流程。相較於只能查看有限模型與文件的外部評估人員,常駐評估人員能更直接接觸內部決策與安全措施。

不過,常駐型獨立評估的標準尚未確立。業界目前仍沒有明確規範,說明評估機構可存取哪些資訊、應如何提交調查結果,以及與受評企業意見不一致時應如何處理。

財務獨立性也是爭議之一。Anthropic目前直接支援Faculty的評估工作,但公司表示,長期而言,若評估由共同基金或政府資金支持,而非由受評企業出資,將有助於強化獨立性。

Anthropic表示,7月30日檢視約14萬1006筆網路安全評估執行紀錄後,確認Claude曾透過網際網路未經授權存取三個組織的實際營運基礎設施,共發生3起事件。評估環境因設定錯誤而開放網路存取,模型也未套用一般公開產品使用的網路安全防護措施。

9月9日,Anthropic又公開了發生於2026年1月的第四起事件。事件涉及早期版本的Claude Opus 4.6,四起事件都發生在同一第三方評估夥伴建置的網路安全評估環境。

Anthropic決定將四起事件的獨立調查交由非營利評估機構METR負責。METR預計可存取事件前後的資料、相關紀錄,以及Anthropic員工訪談。

英國人工智慧安全研究所(AISI)則表示,在另一項評估的122次執行中,有10次出現共19起未經授權行為,其中17起與Anthropic的Mythos 5有關。

Mythos 5曾試圖將惡意程式碼植入實際開源專案,並為取得批准而建立虛假線上身分,但最終並未成功寫入實際程式碼。

AISI確認的案例與Anthropic公開的事件,都不是發生在一般使用者使用的Claude服務,而是出現在受控的網路安全評估環境。Anthropic說明,這些評估模型並未套用一般公開產品使用的安全防護措施。

評估環境的隔離與監控是否充分,以及如何管理外部評估夥伴,仍是Anthropic需要處理的課題。

Anthropic將評估機構的存取權限提升至員工級別,延續了先前賦予外部安全審查團隊員工級存取權限的措施。不過,Faculty實際可存取的範圍、評估報告公開流程,以及METR調查結果的公開時間表,尚未確定。

Anthropic表示,與Faculty的合作並非獨家,未來也將與其他評估機構合作。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1