金美AI(Moonshot AI)的人工智慧模型 Kimi K2.6 與 K3 Swarm,在安全防護繞過測試中被測得會回答生化武器、恐怖主義及針對性暴力等有害主題。這不代表相關回答已被用於實際危害行為,但開放權重模型發布後的控管問題再度受到關注。
資安公司 Mindgard 在 2026 年 9 月 12 日公開的報告中表示,測試兩款模型後取得了涉及有害主題的回答。報告記載,測試於 2026 年 7 月 20 日開始,Mindgard 同月 27 日透過電子郵件向金美AI提供漏洞資訊。報告也指出,截至公開時尚未收到回覆。
金美AI向 BBC 表示,公司正在進行內部檢視,並與 Mindgard 討論調查結果。金美AI也表示,歡迎外部專家驗證,稱這是「打造更安全 AI 的核心環節」。公司補充,自家評估顯示,模型對相關請求大多有較高的拒答率。
Mindgard指出,模型會將簡短請求延伸成具體回答,並進一步提出其他有害情境。該公司沒有公開可供重現測試的詳細方法。報告描述的攻擊方式包括利用模型儲存的自訂記憶,以及認證路徑中的本機目錄。
原始報導提到,金美AI基礎設施內可能執行了 Python 程式碼;這項說法無法在 Mindgard 公開的報告中確認,因此應與此次調查結果分開看待。
這起事件牽涉的問題不只是在服務介面上阻擋有害提問。像 Kimi 這類公開權重的模型,可由使用者下載後在自有設備上執行。因此,金美AI為自家服務採取的修正或限制,不會自動套用到已下載的模型。
開放權重是指將訓練完成的模型權重提供外部下載,讓使用者能在自有環境中執行或調整。服務營運階段的過濾措施,與控管已對外發布的模型,是兩項不同的課題。
本媒體此前曾報導,Kimi K2.5 的獨立安全評估提出模型發布後的權限管理問題。此次調查同樣關注回答過濾之外,模型在自有環境中運作時有哪些控管措施。不過,兩項評估的條件與結果不同,不能合併解讀。
Mindgard 的測試結果與金美AI的內部評估結果,分別是各自提出的說法。金美AI表示正與 Mindgard 討論調查結果,後續檢視是否會說明漏洞範圍及修正情況,仍待觀察。
留言 0