OpenAI、Anthropic與Google三大AI業者的加密「推理區塊」被爆出安全漏洞,同一段加密內容竟可能在不同使用者、不同對話、甚至不同模型之間被重複解讀。研究團隊從公開日誌中破解出31萬5320個「推理區塊」,並從中揪出367筆個人資料與182筆帳號密碼等認證資訊。
根據研究團隊於11日發表的論文,各家AI業者其實是用同一組「全域金鑰」為旗下推理區塊加密,等於同一業者所有推理內容都共用一把鑰匙。研究人員發現,只要把強大模型產生的加密區塊,拿去輸入到同一業者旗下防護較弱的模型,就能誘使對方把原始推理內容以明文方式吐出來,形同變相繞過加密保護。
在解密後的資料中,研究團隊確實挖出密碼、API金鑰等多種認證資訊。研究團隊也提出警告,模型推理過程中可能殘留原本在最終答案裡被擋下的有害內容,加密區塊本身也可能被用來藏匿指令,進而被用於發動「提示注入」(prompt injection)攻擊。
留言 0