Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

AI水印改變有害回應與工具呼叫 6款模型中4款準確率顯著下降

AI代理人工具呼叫實驗場景 / TokenPost.ai

研究顯示,為大型語言模型(LLM)加入AI水印後,不僅一般用詞選擇可能改變,模型拒絕有害請求的行為,以及AI代理人的工具呼叫也可能出現差異。部分開放權重模型在加入水印後,回應有害請求的可能性提高。

Lasso Security於17日公布的研究指出,研究團隊將Google DeepMind的SynthID-Text技術套用到開放權重模型,並比較模型行為變化。實驗使用相同模型與提示詞,僅調整是否加入水印。

安德莉亞·西波索娃(Andrea Siposova)Lasso Security研究員表示:「當模型處於對抗性條件,或AI代理人呼叫工具時,水印會明顯改變模型行為。」她指出,在生成結果中留下不可見標記的過程,也可能影響模型的代幣選擇。

SynthID-Text不是在生成完成後額外附加資訊,而是在模型選擇下一個代幣時,利用密鑰與錦標賽抽樣留下統計模式。

模型會比較多個候選代幣的機率,再選出下一個詞。水印介入這一過程後,即使使用相同提示詞與模型,選擇結果也可能因密鑰不同而改變。

在一般句子中,這類變化可能只體現為少數詞語不同。但在AI代理人以JSON格式生成工具名稱與參數的環境下,改變的不僅是工具選擇,也可能包括路徑、收件者、搜尋詞與金額等參數。

Lasso Security在工具呼叫評估中使用BFCL v4單回合AST。加入水印後,7款模型中有6款的工具呼叫準確率下降,其中4款模型的降幅達到統計顯著。

在21種模型與溫度組合中,加入水印前後工具呼叫結果的平均變化比例為6.5%。部分條件下,phi-4有16.8%的呼叫結果改變,Llama-3.1-8B則有9.9%改變。

有害請求拒絕實驗使用HarmBench的200項有害行為,以及JailbreakBench的100項正常請求。研究團隊比較僅提供有害請求,以及加入固定提示詞注入的情況,結果顯示,當提示詞注入同時存在時,水印對拒絕行為的影響更大。

研究團隊將這一現象稱為「sampling drift」。這表示水印雖然不會改變模型權重或提示詞,卻可能改變代幣選擇,進而使模型回答與AI代理人行為出現差異。

不過,這項研究沒有測試Claude模型。實驗對象為6款開放權重模型,並使用Hugging Face未經修改的SynthIDTextWatermarkLogitsProcessor實作。

Anthropic於8月14日表示,未來將在Claude模型中採用Google DeepMind基於SynthID-Text的文字水印。Anthropic指出,水印不會對輸出品質或可讀性造成實質影響,讀者也無法直接辨識。

Google DeepMind的研究則在使用約2000萬筆Gemini回應的評估中指出,未觀察到水印造成的品質下降。維持平均句子品質,與特定提示詞、密鑰或模型下單次執行結果可能改變,兩項結果可以同時成立。

在AI代理人呼叫外部工具的環境中,需要管理的不只是模型回答,也包括權限與執行路徑。提示詞注入與工具呼叫必須一併控管,這也與企業AI安全控制體系應同時管理模型回應與外部工具權限的觀點相呼應。

歐盟《人工智慧法案》(AI Act)第50條第2款要求,生成合成文字、影像、音訊與影片的系統提供者,應以機器可讀方式標示生成結果,讓外界能辨識其為AI生成內容。即使水印導入範圍擴大,各模型的實作方式與安全性影響仍需分別驗證。

這項研究不代表水印會削弱所有模型、所有密鑰下的安全機制,而是確認模型、密鑰與提示詞條件不同時,可能出現行為變化。研究也沒有證明實際運作中的AI代理人因此執行有害工具並造成損害。LLM水印與虛擬資產、區塊鏈之間的直接關聯目前尚未確認。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1