Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

800億參數AI模型公開:Yandex每個Token僅啟用30億參數

研究筆記旁的人工智慧電路板 / TokenPost.ai

Yandex公開總計800億參數、每個Token處理時僅啟用30億參數的大型語言模型,主攻俄語知識與推理能力,但並非一般使用者可直接使用的完整聊天機器人。

Yandex於21日公布AliceAI-Foundation-80B-A3B-Base,並將模型權重發布至Hugging Face,採用允許商業使用、修改與再發布的Apache 2.0授權。

該模型採用MoE(Mixture of Experts)架構,讓多個專家模組中的部分模組參與計算。模型使用48層與512個專家模組,最大上下文長度為26萬2144個Token。

Yandex表示,模型自始即開始訓練,未使用外部公開模型的權重。不過,不同資料對訓練資料規模的說法並不一致。

《Vedomosti》根據Yandex相關人士的說明,報導訓練規模為18兆個Token。另一方面,模型卡指出,Yandex曾進行多次獨立訓練實驗,每次規模為2兆個Token,因此目前難以將兩個數字視為同一訓練階段的數據。

此次公開的模型不是經過指令訓練或對話微調的產品型模型,而是以預訓練為基礎的模型。開發者仍需針對特定任務進行追加訓練,或將模型整合至應用程式中。

Yandex將該模型定位為未來開發整合式推理模型與Alice AI代理功能的實驗基礎,但尚未公布上市時程或最終產品的性能目標。

性能評估顯示,該模型在俄語領域具備一定優勢。模型卡顯示,AliceAI在俄語事實知識基準WikiWebFacts與HardMultiQA中,分別取得86.5分與67.9分。

在相同評估中,DeepSeek-V4-Flash-Base分別取得83.2分與65.4分。WikiWebFacts與HardMultiQA是Yandex公開、用於評估俄語事實知識與專業領域能力的基準。

不過,英語評估結果有所不同。在TriviaQA中,AliceAI取得79.0分,低於DeepSeek-V4-Flash-Base的89.4分,以及Nemotron-3-Super-120B-A12B-Base的89.8分。

模型卡中的性能比較,是以Yandex設計的評估環境與基準為基礎。目前尚未確認有獨立機構在相同條件下重現相關結果。

稀疏架構是在維持模型整體容量的同時,讓部分專家在處理每個Token時參與計算。不過,不能僅憑啟用參數為30億個,就斷定執行模型所需的設備門檻較低。

原因在於,模型完整權重仍需以800億個參數的規模儲存。Hugging Face頁面則提供使用vLLM、SGLang與Transformers執行模型,以及進行追加訓練的範例。

業界評價並不一致。《Vedomosti》報導,俄羅斯聯邦儲蓄銀行(Sberbank)認為,此次公開是展現俄羅斯工程能力的案例,但也指出,全球AI競爭的標準仍是數百億至數兆參數規模的旗艦模型。

俄羅斯數位經濟相關組織與AI產業聯盟人士則認為,開放授權可降低開發商業產品時的法律障礙。不過,實際商業導入規模目前尚未公布。

此次公開的意義,不僅在於模型總參數量,也在於同時公開模型權重,以及每個Token僅啟用部分參數的架構。大規模稀疏模型之間的架構比較,也曾在TokenPost先前報導DeepSeek V4.1 Flash公開啟用參數中討論。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1