Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

MiniCPM5-2B自稱奪4B以下最強 官方倉庫卻查無蹤影

可見模型儲存庫與排行榜畫面的筆記型電腦螢幕/TokenPost.ai

中國AI企業OpenBMB的小型語言模型「MiniCPM5-2B」被指出在人工智慧評測指標「Artificial Analysis Intelligence Index」v4.2中拿下15分,在參數量低於40億(4B)的開源模型中排名第一。不過,這款模型的公開檢查點(checkpoint),無論是在OpenBMB官方儲存庫或Hugging Face上都找不到。

報導這項消息的是Cryptobriefing。根據Artificial Analysis於4日(當地時間)公佈的v4.2版本說明,此次更新新增了AA-Briefcase與Surge旗下GDP.pdf作為評測項目,並將不對外公開的「私密(held-out)」測試比重拉高至40%。

耐人尋味的是,在Artificial Analysis自家經營的「Tiny」開源模型排行榜上,完全看不到MiniCPM5-2B的蹤影。目前該排行榜前段班由Granite 4.2 3B、G9v3-3B、Qwen3 4B 2507與MiniCPM5-1B包辦。

OpenBMB官方GitHub儲存庫目前標示的現行發布模型是MiniCPM5-1B,下載清單也只列出1B系列。Hugging Face上的MiniCPM5系列頁面同樣只看得到1B、1B-SFT、1B-base、1B-GGUF、1B-MLX,並無2B版本的檢查點。

OpenBMB的商業合作夥伴面壁智能(ModelBest)官網,也只是強調MiniCPM5-1B在Artificial Analysis指數拿下17.9分的成績,同樣查不到2B模型卡。

Artificial Analysis Intelligence Index是一套把多項基準測試分數整合成單一指數、用來比較開源與閉源語言模型表現的評測工具。所謂held-out測試,是指不會出現在模型訓練資料中、僅在評測當下才公開的題組,比重愈高,愈能過濾模型「提前背題」拉高分數的情況。

這次v4.2的改版方向,是拉高代理型(agentic)任務、長文件推理與知識類題目的比重,同時把私密測試比重上調到40%。由於評測架構本身已與舊版不同,MiniCPM5-2B傳出的15分與MiniCPM5-1B的17.9分,很難直接拿來和v4.2以前的版本分數做比較。

小型開源模型之間的基準測試競賽,近來相當熱烈。中國AI企業接連推出大型開放權重模型、爭相在基準排行榜上較勁,也是同樣脈絡下的發展。在單看參數量已經很難分出高下的評測環境裡,OpenBMB陣營釋出的資料,主打的關鍵詞是裝置端執行、本地部署、工具呼叫與混合推理(hybrid reasoning)。

中國AI模型長期在Hugging Face下載量中占有不小比重,也是這場競賽背後的原因之一。OpenBMB同樣選擇把MiniCPM5系列直接上架Hugging Face供人下載。

Hugging Face討論區裡,有一則標題為「MiniCPM5-2B何時推出(MiniCPM5-2B When?)」的貼文,其他討論串裡也能看到催促官方正式發布的留言。

公開鏡像網站上可查到的OpenBMB 1B版本發布文章下方,不少留言肯定其離線執行、桌機端搭載與開發堆疊相容性。這說明市場關注的重點,與其說是「2B能拿幾分」,不如說是「小型模型到底能不能真的裝得上、跑得動」。

獨立分析媒體Remio在報導MiniCPM5-2B「奪下4B以下模型冠軍」的說法時,也指出對應的公開檢查點並不存在,獨立覆現驗證同樣有限。

評測排行榜第一名,不代表實際部署上的優勢就此確立。長文本處理、工具使用、裝置端執行與晶片相容性等項目,都還需要另外驗證。

就目前公開資料來看,能確認的只有MiniCPM5-1B的存在,以及它在Artificial Analysis指數上的優異表現。至於MiniCPM5-2B是否已經公開釋出,無論是OpenBMB、Hugging Face還是面壁智能,任何官方管道都尚未證實。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1