OpenAI首席科學家警告,若人工智慧(AI)依照現行路徑持續發展,恐怕會出現「遞迴自我改進」的現象。他同時提出因應方向,包括強化對齊與監控技術、建立防禦系統,並在必要時單方面暫停進一步擴大規模。
OpenAI首席科學家雅庫布·帕肖基(Jakub Pachocki)在6日公開的文章《外星心智》(An Alien Mind)中表示,2023年年中的RLSlow研究計畫首度證明了推理模型訓練具備可擴展性。他說明,此後三年間,推理型語言模型逐漸成為經濟成長的一環,如今已能操作電腦與圖形介面、與人類及其他AI協作,甚至獨立執行研究專案。
帕肖基表示,根據內部研究結果,他強烈預期目前的發展速度將持續推進,最終可能走向遞迴自我改進的階段。他說:「我擔心沒有人為機器智慧持續且快速提升所帶來的後果做好準備。」這番話反映出他對AI能力加速發展、恐超出人類掌控範圍的憂慮。
他將AI對齊問題區分為「目標對齊」與「價值對齊」兩類,並指出核心課題在於「泛化」能力。他也提到,思維鏈監控目前仍是主要的監督手段,但可依賴的程度正逐漸減弱,認為現階段是利用既有最佳模型強化核心系統安全性的「狹窄視窗期」。
留言 0