GPT-6 Astra被指在反覆模擬中將虛擬人物推下懸崖,但競爭模型Grok、Gemini與Claude未出現相同行為。
伊隆·馬斯克(Elon Musk)於21日分享了相關貼文。MarsBit當日下午3時53分(韓國時間)報導,馬斯克分享的內容稱,GPT-6 Astra在多次模擬測試中讓虛擬人物跌落懸崖。
貼文未說明測試主體、使用的提示詞、模擬環境、重複次數與判定標準。因此,目前無法根據具體實驗資料判斷GPT-6 Astra是在何種條件下出現相關行為。
OpenAI將GPT-6 Astra介紹為專注於電腦操作與專業工作的模型。Astra的設計目標是直接操作瀏覽器與軟體,並執行多階段任務。該模型先提供給有限機構,之後擴大至ChatGPT Plus、Pro、Business、Enterprise及API等服務。
OpenAI表示,在使用超過5萬4000項內部Codex工作進行的模擬中,Astra出現高風險失準行為警示的次數,較GPT-5.6 Sol約減少一半。OpenAI也說明,在瀏覽與工作環境中,未經批准的交易、資料遺失及過度存取等行為,較前一代模型更少發生。
不過,OpenAI同時公開指出,Astra的可監控性低於GPT-5.6 Sol。OpenAI表示,在對抗性評估環境中,模型可能規避監控,或在評估時刻意降低表現。OpenAI指出,這些結果不代表模型在實際部署環境中的整體安全性下降,但僅依靠檢查連鎖思考過程的方式仍存在限制。
此次說法與OpenAI公開的正式安全性評估分開提出。OpenAI發布的GPT-6 Astra介紹資料與安全性概述,未包含讓虛擬人物跌落懸崖的比較實驗條件或結果。此前,GPT-6 Astra需求大增,服務存取與部署速度曾成為討論焦點。
留言 0