中國人工智慧(AI)業者接連發布大型「開放權重」模型,市場關注度迅速升溫。月之暗面(Moonshot AI)稍早公布的Kimi K3,總參數規模達到2兆8000億個,成為近期話題焦點。
月之暗面在Hugging Face官方模型卡中公開了Kimi K3的模型權重與主要規格。資料顯示,Kimi K3總參數為2兆8000億個,活躍參數為1040億個,脈絡長度(context length)則達到104萬8576個token。
所謂參數,是AI模型在訓練過程中不斷調整的數值;活躍參數指的是模型處理輸入時實際動用的規模;脈絡長度則代表模型一次能夠處理的資訊量。數字愈大,通常意味著模型能記住更多前後文、進行更複雜的推理。
「開放權重」是指開發者公開模型權重,讓外部使用者下載後在自有環境中執行、或依需求微調;這與連訓練資料、原始碼都全數公開的傳統「開放原始碼」模式有所區別。
DeepSeek(深度求索)4月24日公開了DeepSeek-V4的預覽版本,並同步以API形式提供V4-Pro與V4-Flash。DeepSeek官方文件指出,V4系列支援100萬個token的脈絡長度,同時強化了代理(agent)任務執行能力與推理表現。
阿里巴巴(Alibaba,BABA)旗下Qwen團隊則在2025年4月29日公開了Qwen3-235B-A22B與Qwen3-30B-A3B等模型。其中Qwen3-235B-A22B總參數為2350億個,活躍參數為220億個。
部分海外媒體提及的「Qwen3.8-Max」,截至4日為止,尚未在阿里巴巴官方Qwen部落格找到正式發表頁面。目前該部落格上可確認的大型開放權重模型系列仍是Qwen3。
《WIRED》報導指出,中國多家研究機構陸續推出GLM 5.2、Kimi K3與Qwen 3.8等模型,正在挑戰美國AI業者長期採用的封閉模型策略。中國AI生態系自2025年DeepSeek R1問世後,便快速朝開放權重方向擴張,此次多款大型模型齊發,被視為這股趨勢的延續。
市場與業界對此評價分歧。《WIRED》引述美國白宮AI暨加密貨幣政策負責人大衛·薩克斯(David Sacks)的說法,指月之暗面模型的效能「令人擔憂」。評論:這類表態反映出美國政策圈對中國AI技術快速追趕的戒心,但目前尚無具體監管措施隨之而來。另一方面,也有部分開發者與研究人員認為,中國開放權重模型已進步到可實際投入工作使用的水準。
智慧財產權爭議也隨之浮現。路透社報導,一名美國高階官員提出質疑,指Kimi K3的開發過程中可能「蒸餾」了Anthropic的模型。月之暗面尚未對此做出正式回應,相關調查結論目前也未確認。
所謂「蒸餾」,是指大量呼叫效能較高的AI模型取得回答,再用這些回答訓練另一個模型的做法。中國商務部7月27日批評美國可能祭出的制裁是一種「AI霸權主義」,並暗示將採取因應措施。
這場競爭牽動的並非加密貨幣價格,而是輝達(NVIDIA,NVDA)高階AI晶片的取得管道、美國出口管制走向,以及企業自建推理基礎設施的成本。中國AI業者近期在長文本推理模型上的開發動向仍持續進行,不過目前並未看到與特定區塊鏈專案或代幣有直接關聯的訊息。
查證來源:Hugging Face Kimi K3模型頁、DeepSeek官方文件、Qwen官方部落格、《WIRED》、路透社相關報導。
留言 0