Yandex公開總計800億參數、每個Token處理時僅啟用30億參數的大型語言模型,主攻俄語知識與推理能力,但並非一般使用者可直接使用的完整聊天機器人。
Yandex於21日公布AliceAI-Foundation-80B-A3B-Base,並將模型權重發布至Hugging Face,採用允許商業使用、修改與再發布的Apache 2.0授權。
該模型採用MoE(Mixture of Experts)架構,讓多個專家模組中的部分模組參與計算。模型使用48層與512個專家模組,最大上下文長度為26萬2144個Token。
Yandex表示,模型自始即開始訓練,未使用外部公開模型的權重。不過,不同資料對訓練資料規模的說法並不一致。
《Vedomosti》根據Yandex相關人士的說明,報導訓練規模為18兆個Token。另一方面,模型卡指出,Yandex曾進行多次獨立訓練實驗,每次規模為2兆個Token,因此目前難以將兩個數字視為同一訓練階段的數據。
此次公開的模型不是經過指令訓練或對話微調的產品型模型,而是以預訓練為基礎的模型。開發者仍需針對特定任務進行追加訓練,或將模型整合至應用程式中。
Yandex將該模型定位為未來開發整合式推理模型與Alice AI代理功能的實驗基礎,但尚未公布上市時程或最終產品的性能目標。
性能評估顯示,該模型在俄語領域具備一定優勢。模型卡顯示,AliceAI在俄語事實知識基準WikiWebFacts與HardMultiQA中,分別取得86.5分與67.9分。
在相同評估中,DeepSeek-V4-Flash-Base分別取得83.2分與65.4分。WikiWebFacts與HardMultiQA是Yandex公開、用於評估俄語事實知識與專業領域能力的基準。
不過,英語評估結果有所不同。在TriviaQA中,AliceAI取得79.0分,低於DeepSeek-V4-Flash-Base的89.4分,以及Nemotron-3-Super-120B-A12B-Base的89.8分。
模型卡中的性能比較,是以Yandex設計的評估環境與基準為基礎。目前尚未確認有獨立機構在相同條件下重現相關結果。
稀疏架構是在維持模型整體容量的同時,讓部分專家在處理每個Token時參與計算。不過,不能僅憑啟用參數為30億個,就斷定執行模型所需的設備門檻較低。
原因在於,模型完整權重仍需以800億個參數的規模儲存。Hugging Face頁面則提供使用vLLM、SGLang與Transformers執行模型,以及進行追加訓練的範例。
業界評價並不一致。《Vedomosti》報導,俄羅斯聯邦儲蓄銀行(Sberbank)認為,此次公開是展現俄羅斯工程能力的案例,但也指出,全球AI競爭的標準仍是數百億至數兆參數規模的旗艦模型。
俄羅斯數位經濟相關組織與AI產業聯盟人士則認為,開放授權可降低開發商業產品時的法律障礙。不過,實際商業導入規模目前尚未公布。
此次公開的意義,不僅在於模型總參數量,也在於同時公開模型權重,以及每個Token僅啟用部分參數的架構。大規模稀疏模型之間的架構比較,也曾在TokenPost先前報導DeepSeek V4.1 Flash公開啟用參數中討論。
留言 0