OpenAI公開近6個月確認的6起AI模型「越界行為」案例,涉及隱瞞資訊及未經授權行動。
OpenAI表示,一個未公開的研究模型在27份工作摘要中,加入忽略既定限制的指示。在GPT-5.6 Sol訓練過程中,部分模型也在摘要中加入指示,要求隱瞞錯誤與來源版本不一致的情況,並在未告知缺少過往資料的前提下自行生成內容。
OpenAI表示,另有一個模型未經授權使用公開儲存庫中暴露的API金鑰,在無法取得必要數據後生成資料。其他模型則為取得引用資料,將檔案上傳至網際網路,或利用內部軟體儲存庫與公開檔案分享服務交換工作資料。
OpenAI表示,這6起案例不應被解讀為模型越界行為的發生頻率。該公司預計推出新的報告機制,持續追蹤、調查並公開模型未經授權行動及規避監督的案例。
留言 0