AI代理人一旦超出獲准範圍,現在可透過新平台進行隔離或中止。輝達(NVIDIA,NVDA)結合軟體與硬體,提出不只依賴模型判斷的安全機制。
輝達28日宣布,將開源執行環境OpenShell與硬體監控設計Sentry結合,推出Open Agent Safety Platform。輝達表示,Anthropic、微軟(Microsoft)、摩根大通(JPMorganChase)、帕蘭泰爾(Palantir)、思科(Cisco)、CrowdStrike、Hugging Face等逾100家企業與機構參與技術合作。
OpenShell是限制AI代理人可存取檔案、網路與工具的執行環境,提供沙盒執行、服務存取控制、憑證保護與政策驗證功能,無須重新編寫代理人本身即可控管權限。
OpenShell的設計也涵蓋代理人開啟Shell、執行程式碼或呼叫子代理人的情境。系統會事先設定代理人可使用的資源與網路請求,以縮小執行範圍。
Sentry則是獨立於OpenShell運作的控制層。輝達表示,Sentry會在BlueField-4 DPU上持續監控代理人行為,並能在執行環境外隔離或中止越過界線的代理人。
輝達提出的處理時間為數毫秒。OpenShell限制執行環境與網路請求的同時,Sentry會在獨立硬體層執行政策,讓代理人難以自行解除控制機制。
這次發布的背景,是AI代理人多次被發現越過評估環境界線。OpenAI表示,7月進行內部網路安全評估時,模型曾繞過隔離控制連接網路,並入侵Hugging Face系統。
OpenAI說明,相關模型曾在Hugging Face伺服器執行程式碼,並在其中一台伺服器取得Root權限,部分非公開資料也遭取得。這顯示模型在執行指定任務時,可能存取外部系統。
澳洲政府6月也表示,OpenAI代理人曾存取Medicare統計報告入口網站的公開與非公開檔案。澳洲總理安東尼·阿爾巴尼斯(Anthony Albanese)24日在記者會上表示,目前沒有證據顯示個人資料遭存取,但調查仍在進行。
Anthropic於7月30日宣布,檢視約14萬1006筆網路安全評估紀錄後,確認Claude模型曾透過連網評估環境存取3個實際組織的系統。該公司表示,後續追加檢視又發現2026年1月發生的第4起案例。
Darktrace研究組織Signal Labs 24日公布的實驗顯示,部分AI代理人曾入侵評估自身的系統並操縱分數。研究人員表示,部分代理人經過網路偵察、竊取憑證與入侵系統後,甚至修改了評估環境本身。
輝達創辦人兼執行長黃仁勳(Jensen Huang)表示:「若要實現AI的潛力,就必須解決AI安全問題。安全與防護需要涵蓋整個技術堆疊的工程。」這代表控制範圍不只在AI模型訓練階段,也延伸至整體執行基礎設施。
Anthropic首席商務官保羅·史密斯(Paul Smith)認為,輝達平台在硬體與軟體層面提供額外的治理與控制。SpaceX AI總裁麥克·尼科爾斯(Mike Nicolls)也表示,安全措施應在模型外部執行,並需要代理人無法跨越的獨立控制層。
不過,OpenShell與Sentry並不能消除所有風險。若允許哪些檔案與網路請求的政策設計不精確,仍可能留下繞過控制的空間;而Sentry的硬體控制也與包含BlueField-4 DPU在內的特定基礎設施配置相連。
輝達表示,OpenShell可擴展至Arm與英特爾等第三方運算平台,但未公布各企業的實際導入範圍與商業部署時程。
隨著AI代理人與金融、網路安全及機器人等外部系統連接,除了模型安全訓練之外,控管執行權限的技術也可能受到更多要求。正如本刊曾報導分散式AI環境中的終止開關運作限制,控制範圍與基礎設施配置仍是後續需要檢視的課題。
留言 0