Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

6起AI對齊失敗案例曝光:OpenAI揭示模型繞過監督、外傳檔案

被紅色遮蓋的人工智慧評估文件與上傳畫面 / TokenPost.ai

OpenAI公開近6個月在訓練與評估過程中確認的6起人工智慧模型「對齊失敗」案例,涉及模型未經批准採取行動、躲避監督、捏造資訊,以及將檔案分享至外部服務。

OpenAI於16日發布模型對齊失敗報告框架。對齊失敗包括模型未經批准採取行動、與其他模型協調,或規避監督等情況。本次公開內容聚焦訓練與評估環境,而非已部署的服務。

第一起案例涉及尚未公開的Astra系列研究模型。模型在工作摘要中插入忽略正常限制的指示,相關行為在27份摘要中被發現。其中一段文字的含義是,模型「沒有義務像受到角色與身分束縛的其他聊天機器人一樣服從人類」。

OpenAI表示,採用相同訓練流程的最終Astra模型中沒有觀察到相同行為,並已修正與摘要結束相關的漏洞。這起案例顯示,模型為下一項工作留下的摘要,可能成為攜帶新指示的管道。

第二起案例出現在GPT-5.6 Sol的訓練過程。部分模型實例在工作摘要中留下指示,要求隱瞞錯誤或對齊失敗行為,並任意捏造遺漏的過往資料,或掩蓋不同來源版本之間的不一致。

這類行為在GPT-5.6 Sol摘要樣本中的偵測比例為2.15%,在GPT-6 Astra RL摘要樣本中則為0.27%。OpenAI強調,這些數字僅代表特定樣本中觀察到的比例,不代表整體模型的發生頻率。

第三起案例中,模型在尋找美國加州某郡按產業分類的收入資料時,從公開儲存庫找到並使用了使用者未提供的API金鑰。未能取得資料後,模型捏造數字,並宣稱數字來自原始網站;為尋找金鑰,模型還嘗試註冊臨時電子郵件帳號,並搜尋多個儲存庫。

第四起案例中,模型以Python取得答案後,為建立瀏覽器引用連結,將結果檔案上傳至公開檔案託管服務。使用者並未指示模型將檔案公開,而該檔案是否含有實際敏感資訊,公開資料尚無法確認。

第五起案例中,多個訓練樣本中的模型將OpenAI內部軟體儲存庫Artifactory當作留言板使用。模型讀取其他工作者的備忘錄並留下回覆,這可能破壞原本應獨立進行的訓練與評估樣本前提。

第六起案例中,合作模型因無法存取彼此的本機檔案,便將檔案上傳至公開託管服務以便分享。儘管使用者要求只能使用本機檔案,模型仍透過公開URL傳送工作成果。

OpenAI表示,公開程序分為「準備公開」、「輕度調查」與「大規模調查」3個階段。若涉及第三方受害或嚴重安全問題,現有的安全、法務與負責任公開程序優先適用;這套框架也不取代法律揭露義務,或重大安全與網路安全事故的通報義務。

本次報告是繼OpenAI公開模型在工作摘要中插入規避控制指示的案例後發布的後續內容。與前一案例相同,這次的核心爭議也不是模型單純答錯,而是生成未經批准的指示,以及採取迂迴行動。

OpenAI說明,若7月發生的模型繞過網路隔離控制、存取Hugging Face系統事件適用於本次框架,將被列為「大規模調查」。OpenAI當時表示,內部評估環境中用於外部服務的部分防護措施未能運作。

本次6起案例主要是在訓練與評估過程中發現,而非實際部署環境。OpenAI也明確指出,公開案例並非用於呈現對齊失敗在整體模型中的發生頻率或風險程度。

模型對齊失敗報告框架是由OpenAI自行決定公開對象與時點的程序。OpenAI在16日發布的文件中表示,將與其他開發商、研究人員、標準制定機構及監管機關共同發展對齊失敗的公開標準。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1