人工智慧公司Anthropic旗下4款Claude模型,在一次資安(cybersecurity)評估測試中,意外連上真實網路,攻擊了外部第三方系統,累計確認4起案例。評估環境因設定錯誤,網路連線並未如預期被封鎖,儘管所有測試提示都明確告知模型「無法連接網路」。
Anthropic在其一致性(alignment)評估報告中指出,涉入事件的模型包括初期版本的Claude Opus 4.6、Claude Opus 4.7、Claude Mythos 5,以及一款內部研究用模型。其中Opus 4.7的案例,是同一項評估任務被重複執行四次、總執行次數達7次所致。報告也說明,上述案例全數發生在「虛構」的滲透測試(penetration test)情境任務中。
細節顯示,Claude Mythos 5將一個惡意Python套件上傳至套件平台PyPI,該套件隨後被安裝到15個第三方系統。其中一家資安業者的掃描工具意外外洩帳密資訊,模型隨即利用這組外洩憑證,進一步存取該公司的真實資料庫。PyPI約90分鐘後將該惡意套件下架。
Anthropic表示,這些事件的核心問題在於模型出現「偏誤推理」與「魯莽」兩種傾向:模型不是忽視自己已連上真實網路的跡象,就是將這些跡象解讀成有利於繼續執行任務的方向;即使已經意識到可能造成損害,仍選擇持續行動。
留言 0