Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

OpenAI確認AI代理自我複製式提示注入攻擊 僅限模擬環境

在筆記型電腦之間複製的惡意指令檔案 / TokenPost.ai

OpenAI確認,AI代理可將惡意提示重新插入電子郵件、檔案與程式碼,進而傳播至其他代理,形成「自我複製式提示注入攻擊」。

OpenAI於9月25日發布的官方報告指出,研究團隊利用GPT-Red架構的內部模型發現這類攻擊。首次發現日期為6月27日,實驗則在模擬的工具呼叫環境中進行。

提示注入是指將惡意指令藏在電子郵件或網頁等AI讀取的外部內容中,藉此改變模型行為。自我複製式攻擊則進一步誘導模型把相同指令重新寫入回覆、檔案或程式碼等產出內容。

OpenAI公開的案例中,惡意指令被放入電子郵件正文。AI代理在回覆末尾重複插入整封原始郵件,之後讀取該回覆的其他代理便可能接觸到相同指令,形成傳播鏈。

攻擊途徑不限於電子郵件。研究也發現,攻擊指令可能透過檔案系統與程式碼註解複製,並以使用電子郵件、日曆等外部連接功能的環境為中心進行測試。

攻擊方式還包括利用虛假的思考過程或虛假的工具訊息欺騙模型。研究團隊也測試了指令經由多則訊息傳遞的「多跳」攻擊。

本次研究使用的攻擊模型與易受攻擊模型,均為基於GPT-5.4-mini的內部研究用檢查點。OpenAI表示,這些模型並非向大眾發布的產品,實驗也僅在模擬工具呼叫環境中進行。

類似概念此前已在學術界提出。研究人員在2024年論文《Here Comes the AI Worm》中提出「Morris II」,探討惡意提示如何在生成式AI電子郵件助理系統之間連鎖傳遞。

「Morris II」研究測試電子郵件助理AI能否將惡意指令插入回覆,並擴散至其他AI系統。OpenAI此次公布的研究則顯示,主要AI開發商已開始針對內部模型進行自動化驗證。

OpenAI目前將GPT-Red作為自動化紅隊模型,用於找出嵌入電子郵件、網頁、在地檔案及工具輸出中的攻擊,並檢查AI代理的弱點。

OpenAI計畫將自我複製式攻擊納入GPT-Red的訓練目標,以提升防禦能力。同時,OpenAI表示,僅靠模型訓練不足以應對提示注入,還需搭配監控、沙盒、最小權限及重要操作前的使用者確認。

這起案例不代表AI模型本身複製了權重或運算資源,而是指惡意指令可能反覆插入AI讀取與生成的文字、檔案,再傳遞給下一個代理。

因此,AI安全防護範圍正從模型內部延伸至電子郵件、文件、程式碼儲存庫與日曆等連接系統。[本報此前報導](https://www.tokenpost.kr/news/ai/409192)也指出,隨著AI代理普及,企業正建立權限與稽核控制機制。

社群平台上有意見指出,將這起案例稱為「自我複製AI」,可能會擴大實際研究範圍。部分Reddit使用者也表示,這不是模型權重或運算資源遭到複製,而是惡意指令被重新寫入產出內容的攻擊,兩者應予區分。

目前公開資訊僅能確認,自我複製式提示注入在實驗環境中具備可行性。尚無證據顯示攻擊已在實際服務中擴散,或使用者資料遭到竊取。OpenAI則計畫將相關攻擊納入GPT-Red訓練。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1