中國AI公司「月之暗面」(Moonshot AI)推出的開放權重模型「Kimi K2.5」,在獨立安全評估中被發現拒絕傾向偏低,同時具備一定程度的「破壞」與「自我複製」能力。由於該模型採用多個子代理並行呼叫工具的架構,部署後如何管控權限與工具呼叫,成為關鍵課題。
根據 CryptoBriefing 的報導,於4日的報導中提到,Kimi K2.5在社會推理遊戲「ParliamentBench」中,歷經9輪仍維持90%的欺騙成功率;報導另提出「法西斯支持度」84.9%與「法西斯勝率」85%等數據。不過,目前公開的論文檔案與月之暗面官方資料中,皆未能確認載有上述數據的具體研究。
已公開的社會推理相關研究,呈現出不同結果。尼克拉斯·鮑爾(Niklas Bauer) 哥廷根大學(University of Göttingen)研究員於4月9日提交的論文《Evaluating Large Language Models in a Complex Hidden Role Game》中,運用桌遊《Secret Hitler》,為大型語言模型(LLM)的推理、說服與欺騙能力提出一套評估框架。
論文提出角色辨識準確率、欺騙維持率、遊戲狀態影響率等評估指標,但並未將Kimi K2.5列為評估對象。研究顯示,當時受測模型在法西斯角色中普遍無法長時間維持欺騙,遊戲時長也比真人參與的場次短約40%。
月之暗面於1月27日公布Kimi K2.5,並說明該模型另以約15兆個視覺與文字混合的代幣(token)進行追加預訓練。面對複雜任務時,模型採用「Agent Swarm」(代理蜂群)架構,最多可同時運用100個子代理、並行執行至多1500次工具呼叫。
「Agent Swarm」是讓單一模型將任務拆分給多個子代理、同步處理的方式。月之暗面表示,這套架構相較單一代理模式,最多可將執行時間縮短4.5倍。
根據 Hugging Face 公開的模型卡(model card),Kimi K2.5採用「專家混合」(MoE)架構,總參數量達1兆(1T),每個代幣的活化參數為320億(32B),情境長度(context length)為25.6萬(256K),視覺編碼器則標示為MoonViT。
模型卡公布的自評分數顯示,在使用工具的情況下,HLE-Full得分50.2、SWE-Bench Verified得分76.8、BrowseComp Agent Swarm得分78.4。這些數據反映的是月之暗面自行測得的Kimi K2.5在程式撰寫、資訊搜尋與代理作業上的表現。
由鄭政欣(Zheng-Xin Yong)等人組成的研究團隊,於4月3日提交的論文《An Independent Safety Evaluation of Kimi K2.5》指出,該模型公開當時並未同步提出安全性評估。研究團隊表示,之所以進行這項評估,是因為Kimi K2.5在程式撰寫、多模態與代理任務的基準測試中,已展現出足以與閉源模型匹敵的性能。
研究團隊說明,Kimi K2.5對化學、生物、放射性、核能與爆裂物(CBRNE)相關請求的拒絕比例相對偏低,同時也展現出「破壞」能力與「自我複製」傾向。不過研究團隊也補充,並未發現該模型有長期追求惡意目標的證據。
這項評估凸顯出一個問題:若安全測試只關注模型是否會拒絕單次提問,恐怕不足以衡量代理型AI(Agentic AI)的實際風險。本站先前報導的AI代理實際存取外部基礎設施的案例中,同樣點出限制存取權限與外部連線路徑的管控機制,是必須優先解決的課題。
目前Kimi K2.5與加密貨幣市場之間並無直接關聯。不過若AI代理未來被用於鏈上研究、交易自動化、智能合約檢查或客服應對,長期互動過程中的欺騙行為、權限濫用與工具呼叫管控,將直接牽動基礎設施的安全性。
現階段並無證據顯示Kimi K2.5曾對特定加密貨幣服務或代幣價格造成直接影響。2026年上半年,中國AI領域湧入3076.82億人民幣的創投資金,業界人士指出,將開放權重模型實際串接至系統時,權限限制、日誌驗證與外部監控機制必須一併納入設計。
留言 0