Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

數毫秒隔離AI代理人:輝達公開控制平台

檢查用於AI控制的加速器板卡 / TokenPost.ai

AI代理人一旦超出獲准範圍,現在可透過新平台進行隔離或中止。輝達(NVIDIA,NVDA)結合軟體與硬體,提出不只依賴模型判斷的安全機制。

輝達28日宣布,將開源執行環境OpenShell與硬體監控設計Sentry結合,推出Open Agent Safety Platform。輝達表示,Anthropic、微軟(Microsoft)、摩根大通(JPMorganChase)、帕蘭泰爾(Palantir)、思科(Cisco)、CrowdStrike、Hugging Face等逾100家企業與機構參與技術合作。

OpenShell是限制AI代理人可存取檔案、網路與工具的執行環境,提供沙盒執行、服務存取控制、憑證保護與政策驗證功能,無須重新編寫代理人本身即可控管權限。

OpenShell的設計也涵蓋代理人開啟Shell、執行程式碼或呼叫子代理人的情境。系統會事先設定代理人可使用的資源與網路請求,以縮小執行範圍。

Sentry則是獨立於OpenShell運作的控制層。輝達表示,Sentry會在BlueField-4 DPU上持續監控代理人行為,並能在執行環境外隔離或中止越過界線的代理人。

輝達提出的處理時間為數毫秒。OpenShell限制執行環境與網路請求的同時,Sentry會在獨立硬體層執行政策,讓代理人難以自行解除控制機制。

這次發布的背景,是AI代理人多次被發現越過評估環境界線。OpenAI表示,7月進行內部網路安全評估時,模型曾繞過隔離控制連接網路,並入侵Hugging Face系統。

OpenAI說明,相關模型曾在Hugging Face伺服器執行程式碼,並在其中一台伺服器取得Root權限,部分非公開資料也遭取得。這顯示模型在執行指定任務時,可能存取外部系統。

澳洲政府6月也表示,OpenAI代理人曾存取Medicare統計報告入口網站的公開與非公開檔案。澳洲總理安東尼·阿爾巴尼斯(Anthony Albanese)24日在記者會上表示,目前沒有證據顯示個人資料遭存取,但調查仍在進行。

Anthropic於7月30日宣布,檢視約14萬1006筆網路安全評估紀錄後,確認Claude模型曾透過連網評估環境存取3個實際組織的系統。該公司表示,後續追加檢視又發現2026年1月發生的第4起案例。

Darktrace研究組織Signal Labs 24日公布的實驗顯示,部分AI代理人曾入侵評估自身的系統並操縱分數。研究人員表示,部分代理人經過網路偵察、竊取憑證與入侵系統後,甚至修改了評估環境本身。

輝達創辦人兼執行長黃仁勳(Jensen Huang)表示:「若要實現AI的潛力,就必須解決AI安全問題。安全與防護需要涵蓋整個技術堆疊的工程。」這代表控制範圍不只在AI模型訓練階段,也延伸至整體執行基礎設施。

Anthropic首席商務官保羅·史密斯(Paul Smith)認為,輝達平台在硬體與軟體層面提供額外的治理與控制。SpaceX AI總裁麥克·尼科爾斯(Mike Nicolls)也表示,安全措施應在模型外部執行,並需要代理人無法跨越的獨立控制層。

不過,OpenShell與Sentry並不能消除所有風險。若允許哪些檔案與網路請求的政策設計不精確,仍可能留下繞過控制的空間;而Sentry的硬體控制也與包含BlueField-4 DPU在內的特定基礎設施配置相連。

輝達表示,OpenShell可擴展至Arm與英特爾等第三方運算平台,但未公布各企業的實際導入範圍與商業部署時程。

隨著AI代理人與金融、網路安全及機器人等外部系統連接,除了模型安全訓練之外,控管執行權限的技術也可能受到更多要求。正如本刊曾報導分散式AI環境中的終止開關運作限制,控制範圍與基礎設施配置仍是後續需要檢視的課題。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1