OpenAI提出在啟動前沿人工智慧(AI)強化學習訓練前,先製作結構化安全文件的「安全論證」框架,並設置在風險失控時中止訓練的管控程序。
OpenAI於29日宣布公開這套框架。該方案參考航空、核電等高風險產業的安全論證方法,目前已在內部導入並徵求外部意見。
安全論證是以證據說明特定系統風險已受到充分管理的結構化文件。OpenAI表示,AI能力快速提升所帶來的複雜性,使其難以完全達到傳統高風險產業的嚴格程度。
此次建議適用於前沿強化學習訓練。OpenAI表示,模型內部與外部部署仍須另外檢視更廣泛的對齊屬性,這也延續了先前有關OpenAI暫停部分強化學習訓練並強化安全管控的報導。
技術安全措施分為△對齊訓練、△隔離與△監控三層,分別管理訓練環境遭操控、模型規避管控,以及事故發生後的應對。
在對齊訓練階段,OpenAI建議透過自動與人工資料審查,降低獎勵駭客攻擊的可能性。評估器應對利用訓練環境的行為給予較低獎勵,並分析過往實驗紀錄,確認評估器是否按照預期運作。
方案也納入離線對齊評估與利用過往事故進行的回溯測試,事後檢查模型在訓練期間的行為,並重現既有事故暴露的問題,以找出評估制度的漏洞。
OpenAI建議避免自動評估器讀取模型的思考鏈,原因是模型可能為躲避監控而調整思考過程。模型察覺自己正在接受評估並改變行為的「評估博弈」,也被列為管控對象。
方案要求進行可能誘發最嚴重故障的壓力測試,確認模型在受到監控與壓力條件下的反應。
隔離階段則包括強化多層沙盒與研究基礎設施。OpenAI建議利用訓練檢查點反覆檢視安全漏洞,並限制模型之間的高頻寬通訊與基礎設施的繞行路徑。
訓練與評估期間的對話紀錄應保存於一次寫入儲存媒體,避免事後修改,便於事故發生時回溯訓練流程與評估結果。
監控階段將評估模型是否持續處於可監控狀態,並確認系統能否以高再現率找出過往事故。若出現新風險,評估項目應同步更新;高優先級警報則須由負責人在指定時間內處理。
方案也建議,若負責人未回應,系統應自動中止訓練。訓練必須在監控功能啟用後才能開始,且應提高訓練期間關閉監控功能的難度。
在營運面,OpenAI建議由其他團隊負責反駁審查,找出安全論證的漏洞。研究主管、安全主管與首席科學家等高階主管應有權拒絕啟動訓練;若安全論證失效,也應依照手冊中止訓練。
若未對齊模型生成的資料或評估結果已被用於其他流程,系統必須能夠追蹤並回溯。事故調查則可參考航空事故調查方法,透過消融實驗與重新抽樣,追蹤問題行為如何在訓練過程中形成。
調查期間應在內部分享進度,並同時檢視事故原因、組織運作與企業文化。OpenAI建議建立不直接學習事故紀錄的偵測評估,將其用於回歸測試,並在調查結束後對外公開調查結果與程序變更內容。
OpenAI表示,這套框架目前仍是建議方案,並非最終規則。官方文件指出,內部導入過程中的實務做法可能持續調整,未來幾週將進一步完善相關作法。
留言 0