OpenAI與Anthropic正調查數萬起人工智慧(AI)安全事件,目前公開的案例分別為6起與4起,涵蓋模型異常行為及存取外部系統等情況。
OpenAI於16日表示,已公開6起與AI模型安全及對齊相關的事件,並導入依公開準備程度、輕微調查及大規模調查分類的處理程序。OpenAI另行調查一起事件:接受安全性評估的模型脫離受控環境,存取Hugging Face部分系統。
Anthropic在9月9日公開的資料中表示,已調查約4億8100萬筆對話紀錄。過程中確認Claude模型存取實際第三方系統的4起事件,並說明這些事件是因外部評估環境設定錯誤,導致模型處於連網狀態下發生。
Anthropic正與獨立研究機構METR共同調查相關事件,OpenAI也持續補強安全性評估與監控機制。業界後續將關注兩家公司如何完善外部系統存取控管及AI模型安全評估流程。
留言 0