Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

逾10%機率十年內滅絕人類?研究者示警AI自我改進失控風險

AI安全研究員所指的控制架構圖/TokenPost.ai

有研究者評估,人工智慧(AI)在未來十年內導致全體人類滅亡的機率超過10%,這一說法讓「遞歸自我改進」超智能與人類監督能力之間的爭論持續升溫。曾任職Google DeepMind的研究員也提出警告,指AI在接手下一代模型開發的過程中,人類的監督力可能逐漸削弱。

瑞舒布·簡恩(Rishub Jain)是Google DeepMind的前研究員,他認為人類可能無法充分理解AI打造後續模型的方式,因此在今年離開公司。簡恩在《WIRED》的採訪中表示:「AI的發展正在加速,AI能力越強,風險也越大。」這句話點出了他離職的核心考量——技術進步與可控性之間的落差正在拉大。

簡恩所擔心的「遞歸自我改進」,是指AI訓練另一個AI、修改程式碼,甚至接手下一代模型開發流程的結構。截至目前,主要AI研究機構中尚未有任何一家宣稱已建立完全自主的自我改進循環。

不過,動用大規模AI代理群解決複雜問題的做法已經出現。OpenAI於9月5日宣布,其以內部模型為基礎,動用約1萬個代理,成功推導出納維-斯托克斯方程相關問題的解法。

這些代理在約88小時內互相交換了270萬則訊息,之後又花費17小時將結果格式化並完成驗證。OpenAI將這項成果描述為AI發展的一個階段性里程碑,但並未正式宣稱已解開數學界的千禧年大獎難題。

隨著代理數量與協作環節增加,人類想追蹤每個判斷步驟的依據將愈加困難。當AI的角色從輔助研究開發,擴展到參與後續系統的設計,監督的範圍也必須同步擴大。

Anthropic內部也傳出公開警告。傑柯布·考克森(Jacob Coxon)是Anthropic的前研究員,他在宣布辭職時主張:「AI企業正直奔自我改進型超智能而去,正在拿人類的生命當賭注。」這句話反映出部分內部人士對開發速度的深切不安。

艾文·哈賓格(Evan Hubinger)現任Anthropic對齊科學(alignment science)主管,他表示:「我個人認為,AI在未來十年內導致所有人類死亡的機率超過10%。」美聯社(AP)也報導了這一發言

哈賓格的說法並非公司官方預測,而是他個人的風險評估。不過,這番言論仍被視為反映出研究界對高階AI開發速度與安全驗證水準之間落差的普遍憂慮。

「對齊」(alignment)是評估並調整AI行為、使其符合人類意圖與價值觀的技術領域。內特·索雷斯(Nate Soares)是MIRA的電腦科學家,他指出,外界原本期待模型效能提升後對齊會變得更容易,但實際情況卻正好相反,對齊反而變得更困難。

索雷斯強調,當數千個代理彼此協作時,人類追蹤每一個判斷依據的複雜度會顯著提高。他認為,模型變聰明與人類能理解、控制模型行為,是兩個完全不同的問題。

簡恩則將焦點放在讓人類判斷與AI相互結合,而非完全以AI取代人類判斷。離開Google DeepMind後,他創立了Sampura Research,研究讓人類與AI共同評估模型的技術。

Sampura Research計劃在未來六個月專注開發用於評估AI行為準確性與對齊程度的「判定者」機制。Sampura Research提出的目標,是打造一套區分人類與AI角色分工的評估體系。

AI控制爭議並未止步於研究機構內部,也延燒到制度層面的討論。本站先前報導,考克森辭職後,美國國會持續討論限制超智能開發與建立AI監督體系的相關議題

目前尚未出現完全自主的自我改進型AI。已確認的事實是,隨著AI代理的規模與自主性不斷擴大,研究者正對人類監督的侵蝕提出警告,同時也在開發結合人類與AI判斷的控制技術。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1