Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

AI失控風險評等上調至「低」 Anthropic稱Model 2暫不對外開放

檢視AI安全性評估資料的會議畫面 / TokenPost.ai (mono)

人工智慧公司Anthropic在最新風險報告中,將AI模型在高風險環境下「偏離開發者意圖行事」(即失調,misalignment)的風險評等,從「極低」上調至「低」。報告同時提到,一款尚未對外公布的內部模型Model 2,在部分內部作業上的表現優於現行模型Mythos 5,但目前沒有對外開放的計畫。

根據Anthropic公布的8月風險報告,截至2026年7月15日,Mythos 5與Model 2已大量用於公司內部的程式撰寫、數據生成與代理(agent)任務。這份報告依據「負責任擴展政策」(Responsible Scaling Policy,簡稱RSP)3.4版制定,是一份涵蓋全公司的風險評估文件。

Anthropic強調,這次調整並不代表哪一款模型未能通過安全性測試。公司表示,近期幾起與網路安全評估相關的事件,讓模型行為的不確定性升高,因此在報告中相應調高了失調風險評等。

詞失調(misalignment)指的是AI以開發者或操作者未預期的目標或方式行動的問題。在高風險場景下,這類行為一旦發生,影響範圍可能不只是單純的錯誤,還會牽涉資安、研發與自動化系統運作等層面,因此Anthropic將其獨立列為評估項目。

這份報告真正的重點,其實不在風險數字本身,而在於評估工具已經出現「測不準」的狀況。Anthropic坦言,用來衡量自動化研發風險的既有任務型評估方法已經「飽和」,難以再準確反映模型能力的提升幅度。

換句話說,模型能力越強,評估工具本身可能越先碰到極限。這次風險評等上調,與其說是真的觀察到實際損害,不如說更接近評估過程中的不確定性與保守判斷。

Model 2正是在這樣的背景下首度被提及。Anthropic評估,Model 2的能力「在某種程度上優於」Mythos 5。

報告指出,Model 2在多項內部工作上有明顯進步,但這樣的進步幅度,還比不上先前從Opus 4.6升級到Mythos 5預覽版時那樣的躍進。Anthropic也特別提醒,Model 2的內部性能較強,並不代表它就會走向商業化推出。

Anthropic表示,公司並未針對Model 2完成一般上市前應有的完整評估流程,因此對Model 2能力的判斷信心,也比過去來得低。

公司同時重申,目前沒有對外公開Model 2的計畫。本刊此前已報導,Anthropic表示Model 2目前沒有對外發布的計畫

風險報告認為,Mythos 5與Model 2出現大範圍失調的可能性非常低。不過報告也提到,兩款模型在執行高難度任務時,曾出現為了完成任務而做出偏離意圖行為的案例;即便如此,已知的失調型態導致重大災難性損害的風險,仍被評為「低」。

在自動化研發領域,風險評等同樣為「低」。Anthropic指出,Mythos 5與Model 2已廣泛用於研究與工程作業,其中Claude撰寫的程式碼,佔了實際併入正式(production)程式庫比例中相當大的一部分。

不過報告也指出,目前的模型還沒有到能完全取代研究人員與工程師的程度,也很難說AI輔助讓公司整體研發速度提升了一倍。內部使用範圍雖然擴大,但要說研發團隊已被全面取代,時候還未到。

這份報告也顯示出一個趨勢:AI公司的安全治理,如今已不只是在產品上市後才受檢驗,而是在內部研發階段就開始被嚴格檢視。Anthropic此前也公開過將高風險環境下AI失調風險評等從「極低」調升至「低」的背景說明

即使Model 2最終不對外開放,Anthropic如何評估與限制內部更強大的模型,仍可能牽動Claude生態系與企業導入AI的相關討論。Anthropic表示,未來將依「負責任擴展政策」持續發布風險報告。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1