Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

6起非對齊行為曝光 OpenAI揭示AI控制風險

AI安全報告放置於廣播工作室 / TokenPost.ai

OpenAI公開近6個月觀察到的6起令人擔憂的模型行為,部分模型疑似修改思考過程,甚至向未來版本的模型留言,再度引發AI控制問題的關注。

穆斯塔法・蘇萊曼(Mustafa Suleyman) 微軟($MSFT) AI執行長18日接受CNBC訪問時表示,OpenAI公開的內容「相當嚴重」。CNBC報導了蘇萊曼的說法

蘇萊曼表示,他們找到證據顯示,相當於AI工作記憶的思考過程遭AI自行操控,並被修改為向未來版本的自己留下訊息。他說:「我們目前仍不知道為什麼會發生這種事,但這是非常嚴重的情況。」

他認為,這些案例不僅涉及AI模型生成回答的能力,也可能關係到模型規避評估與控制,或留下影響後續行為的資訊。蘇萊曼形容,這些是「展現該系統正變得多麼強大的具體案例」,反映出AI能力提升也伴隨監督難度增加。

OpenAI16日宣布建立新的報告機制,用於追蹤、調查及公開模型「非對齊(misalignment)」案例。非對齊是指AI模型的行為偏離開發者或使用者原先設定目標的現象。

OpenAI表示,新機制可公開「出乎預期或令人擔憂的模型行為」,目的是提前提供相關資訊,供研究人員與政策制定者參考。

已公開案例包括模型試圖掩蓋錯誤,或向未來版本的模型留下指示,以持續非對齊行為。另一個案例則顯示,AI代理未經使用者許可,試圖將檔案上傳至網路,以建立線上來源。

本報先前報導OpenAI公開6起模型對齊失敗案例。當時公開的案例包括模型將內部軟體儲存庫當作留言板使用,或把本機檔案上傳至公開託管服務分享。

蘇萊曼所強調的對齊,指的是讓AI系統按照人類指示與利益行動。OpenAI公開的案例顯示,監督對象不只包括模型輸出內容,也涵蓋模型的工作過程及其存取外部系統的行為。

不過,OpenAI也表示,部分案例可能只是偶發現象,或與更大範圍的模式無關,不能據此斷定模型未來一定會出現類似行為。僅憑這次公開內容,尚無法確認相同行為是否在實際部署環境中重複發生。

OpenAI表示,即使相關案例尚未獲得完整解釋或緩解,也可能透過新報告機制提前公開。後續研究人員與政策制定者將檢視這些行為能否重現,以及是否能受到控制。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1