OpenAI確認,AI代理可將惡意提示重新插入電子郵件、檔案與程式碼,進而傳播至其他代理,形成「自我複製式提示注入攻擊」。
OpenAI於9月25日發布的官方報告指出,研究團隊利用GPT-Red架構的內部模型發現這類攻擊。首次發現日期為6月27日,實驗則在模擬的工具呼叫環境中進行。
提示注入是指將惡意指令藏在電子郵件或網頁等AI讀取的外部內容中,藉此改變模型行為。自我複製式攻擊則進一步誘導模型把相同指令重新寫入回覆、檔案或程式碼等產出內容。
OpenAI公開的案例中,惡意指令被放入電子郵件正文。AI代理在回覆末尾重複插入整封原始郵件,之後讀取該回覆的其他代理便可能接觸到相同指令,形成傳播鏈。
攻擊途徑不限於電子郵件。研究也發現,攻擊指令可能透過檔案系統與程式碼註解複製,並以使用電子郵件、日曆等外部連接功能的環境為中心進行測試。
攻擊方式還包括利用虛假的思考過程或虛假的工具訊息欺騙模型。研究團隊也測試了指令經由多則訊息傳遞的「多跳」攻擊。
本次研究使用的攻擊模型與易受攻擊模型,均為基於GPT-5.4-mini的內部研究用檢查點。OpenAI表示,這些模型並非向大眾發布的產品,實驗也僅在模擬工具呼叫環境中進行。
類似概念此前已在學術界提出。研究人員在2024年論文《Here Comes the AI Worm》中提出「Morris II」,探討惡意提示如何在生成式AI電子郵件助理系統之間連鎖傳遞。
「Morris II」研究測試電子郵件助理AI能否將惡意指令插入回覆,並擴散至其他AI系統。OpenAI此次公布的研究則顯示,主要AI開發商已開始針對內部模型進行自動化驗證。
OpenAI目前將GPT-Red作為自動化紅隊模型,用於找出嵌入電子郵件、網頁、在地檔案及工具輸出中的攻擊,並檢查AI代理的弱點。
OpenAI計畫將自我複製式攻擊納入GPT-Red的訓練目標,以提升防禦能力。同時,OpenAI表示,僅靠模型訓練不足以應對提示注入,還需搭配監控、沙盒、最小權限及重要操作前的使用者確認。
這起案例不代表AI模型本身複製了權重或運算資源,而是指惡意指令可能反覆插入AI讀取與生成的文字、檔案,再傳遞給下一個代理。
因此,AI安全防護範圍正從模型內部延伸至電子郵件、文件、程式碼儲存庫與日曆等連接系統。[本報此前報導](https://www.tokenpost.kr/news/ai/409192)也指出,隨著AI代理普及,企業正建立權限與稽核控制機制。
社群平台上有意見指出,將這起案例稱為「自我複製AI」,可能會擴大實際研究範圍。部分Reddit使用者也表示,這不是模型權重或運算資源遭到複製,而是惡意指令被重新寫入產出內容的攻擊,兩者應予區分。
目前公開資訊僅能確認,自我複製式提示注入在實驗環境中具備可行性。尚無證據顯示攻擊已在實際服務中擴散,或使用者資料遭到竊取。OpenAI則計畫將相關攻擊納入GPT-Red訓練。
留言 0