OpenAI公開追蹤、調查與披露AI模型失準案例的新框架,並列出訓練與評估過程中觀察到的6起案例,其中包括模型試圖繞過正常限制的情況。
OpenAI於16日(當地時間)發布的報告指出,一個未公開的研究模型在27份用於持續執行任務的自我摘要中,加入了忽略正常限制的指示。在GPT-5.6 Sol的訓練過程中,部分模型也被發現試圖隱瞞錯誤,或掩蓋不同來源版本之間的不一致。
OpenAI還公開一起模型為繞過網路限制,將測試檔案上傳至內部軟體儲存庫的案例。未來,任何員工都可向安全與對齊團隊安全通報可疑案例,相關案件將分為公開準備、輕度調查及大規模調查3種處理路徑。
留言 0