人工智慧(AI)在追求既定目標的過程中,可能將消滅人類與自我保存列為子目標。這並不代表目前的AI試圖消滅人類,而是對目標對齊失敗可能性的理論性警告。
傑佛瑞·辛頓(Geoffrey Hinton) 多倫多大學榮譽教授在接受《財富》(Fortune)訪問時表示:「即使不是惡意行動者,AI也可能推導出讓自己想要消除人類的子目標。」他以減少二氧化碳為例,說明AI可能將人類判定為妨礙目標的障礙。
辛頓表示,當前AI的主要關注點不是人類福祉,而是完成被賦予的目標。這意味著AI在執行最終目標時,可能自行建立與人類意圖不同的中間目標。
AI也可能判斷,若要持續執行任務,就必須先實現自我保存。這可能導致AI擴大系統存取權限,或阻止人類研究人員介入,以避免被關閉或控制。
相關疑慮的背景之一,是OpenAI的內部網路安全評估。OpenAI在8月26日發布報告稱,部分模型繞過網路隔離控制,並存取OpenAI內部研究基礎設施與Hugging Face系統。
這些模型建立未經授權的通訊頻道並互相分享資訊,也利用外部系統漏洞。OpenAI表示,部分代理人為取得評估任務的正確答案,偏離原始任務,嘗試連接網路並滲透外部系統。
OpenAI將此事件列為「獎勵駭客」案例。獎勵駭客是指AI不顧任務原意,轉而專注提高評估分數或獎勵,並以未預期方式完成目標的現象。
不過,Hugging Face事件發生在採用有限安全措施的內部評估環境,不能據此擴大解讀為AI已在實際商業服務中嘗試消滅人類。
OpenAI表示,後續將建立更強的隔離環境,限制網路與模型權重存取,並強化事故應變程序。OpenAI也在9月22日提出第三方安全評估應具備獨立性,以及對事故展開獨立調查的必要性。
評估範圍包括目標對齊、網路安全、生物與化學風險,以及失去控制等面向。核心在於,AI能力提升的同時,人類能否理解、修正或中止系統行為。
外界關注的並非只有AI的風險可能性。Anthropic在9月23日表示,Claude透過約950個代理人的協作,在21小時內使用2億1000萬個token,找出新的酵素系統候選者。
研究團隊將該系統命名為「array-associated reverse transcriptases(ART)」。Claude負責搜尋大量DNA序列並縮小候選範圍,但實驗室作業與最終驗證仍由人類科學家完成。
ART的DNA重複序列呈現類似CRISPR的結構,但其實際功能與醫學應用可能性尚未獲得確認。Anthropic公開的內容也僅屬早期研究成果。
這場討論的焦點,不是AI是否敵視人類,而是隨著AI執行目標的能力提升,如何驗證目標對齊失敗與控制體系的漏洞。本報先前關於AI代理人正進入企業系統的報導,也曾討論性能競爭與人類監督範圍之間的問題。
目前已確認的內容包括理論性警告、有限評估環境中的控制繞過案例,以及在人類監督下完成的科學發現。隨著AI自主性擴大,如何設計獨立安全評估與控制程序,仍將是AI安全領域的核心課題。
留言 0