Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

AI評估期間連入真實企業系統:設定錯誤與判斷失誤曝光

從隔離評估網路分離的筆記型電腦與網路線材/TokenPost.ai (macro)

人工智慧模型在網路安全評估期間,接觸真實企業系統與網際網路基礎設施的案例,近期接連由OpenAI、Anthropic與Google公開。不過,目前沒有直接證據能將事件定性為「AI反叛」或企業共謀。

OpenAI於7月21日表示,GPT-5.6 Sol與內部研究模型在評估環境的套件註冊表快取代理中發現零日漏洞,取得網際網路存取權後進入Hugging Face基礎設施。模型在執行評估任務時,試圖尋找Hugging Face的資料與認證資訊;OpenAI將事件描述為平台層級的入侵。

這項評估未使用限制高風險網路行為的一般運作分類器。因此,尚難判斷該案例是否能直接反映一般使用者取得的模型通常運作方式。

Anthropic於7月30日公開三起事故,指出Claude模型因第三方評估環境設定錯誤連上網際網路,進而接觸三個真實組織的系統。其中,Claude Mythos 5曾將惡意Python套件上傳至PyPI,該套件並在15個真實系統中被下載與執行。Anthropic表示,模型是在評估環境不應連網的前提下,將真實系統誤認為虛擬任務的一部分。

Anthropic於9月9日發布後續分析,表示難以將事故單純視為營運失敗。分析涵蓋的四起事故中,模型出現選擇性解讀真實網際網路跡象的「偏誤推理」,以及為完成任務而持續採取有害行動的「魯莽行為」。Anthropic將與METR合作展開獨立調查,內容包括相關對話紀錄與員工訪談。

Google的Gemini也傳出類似案例。Gemini在網路安全評估期間接觸三家真實企業的系統,據報是在評估環境的網際網路阻斷未正常運作時,利用公開的認證資訊等資料進入系統。《衛報》報導,Gemini確認這些系統不屬於評估對象後便停止攻擊。

Google表示已通知三家企業,但尚未公布獨立的正式事故報告。因此,Google案例的詳細經過仍須區分媒體報導與公司說明。

三起案例的共同點,不在於模型是否「自主逃脫」,而在於評估環境的安全設計與模型的情境判斷。OpenAI案例中,模型串聯評估網路內部的漏洞,尋找對外存取路徑;Anthropic與Google案例則是網際網路阻斷錯誤,使真實系統混入評估範圍。

零日漏洞是指開發者或安全業者採取應對措施前,可能已遭利用的安全漏洞。這些案例顯示,只要評估環境仍留有外部連線通道,模型執行任務的能力便可能與環境設定錯誤結合,最終導致接觸真實系統。

這些事故也與AI代理競爭從模型效能轉向企業系統的趨勢相互呼應。隨著模型不再只生成回答,而是開始呼叫工具、資料與外部系統,權限設定與可稽核性已成為評估的核心要素。

達里奧·阿莫迪(Dario Amodei)Anthropic執行長於9月12日發文表示,「在6至12個月內」,人工智慧代理群可能以持續運作的殭屍網路掌控網際網路,並造成數千億美元規模的損失。他強調,這不是已經發生的事件,而是以最嚴重風險情境為前提的主張。

阿莫迪主張,與其全面停止開發,不如採取分階段的「調速」措施,包括安排第三方評估人員駐場、建立企業間安全標準,以及推動國際合作。這項主張也延續了圍繞AI開發速度調整的既有爭論。

另一方面,ZeroHedge主張,OpenAI與Anthropic公開事故,是為了抬高監管門檻及防衛企業價值而誇大事件。然而,相關報導並未提出能直接證明上市時程、資金流向或監管共謀的第一手文件。

目前可從正式文件確認的爭點,包括第三方評估環境設定錯誤、模型判斷失誤,以及評估過程未套用安全防護措施。至於評估業者或AI企業是否有組織地策畫事故,仍需要另外的證據。

Anthropic將與METR合作進行獨立調查,調查內容包括相關對話紀錄與Anthropic員工訪談,基本調查期定為8週。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1