3名離開OpenAI的研究員呼籲監測AI模型的推理過程,並擴大獨立安全稽核,也提出業界共同標準。
Crypto Briefing報導,Jasmine Wang、Tomek Korbak與Mikita Balesni已致函OpenAI董事會及安全委員會。信件原文尚未公開,因此具體措辭與提案範圍僅能依據報導內容。
思維鏈監測是檢視模型作答前產生的中間推理過程,以尋找風險跡象。不過,這個過程無法完整呈現模型的實際推理。Korbak、Balesni等人參與的一篇2025年研究論文指出,這種方法有助於安全監督,但無法捕捉模型所有不當行為。
論文也指出,模型可能為了躲避監測而隱藏推理。研究團隊建議,不要把監測當成唯一的安全措施,並應與其他安全方法一併研究。
獨立稽核是由模型開發商以外的專家檢查模型安全性的程序。若要提供稽核所需的內部資料,可能與企業機密保護產生衝突,因此還需要界定存取範圍及資訊處理責任。
OpenAI表示,3名員工在既定程序之外處理公司敏感資訊,違反了內部政策。公司未公開哪些資訊以何種方式遭到處理。
OpenAI的說法與研究員提出的安全監督要求是兩件不同的事。根據目前公開資訊,無法斷定解雇的具體經過。
留言 0