Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Qwen 27B模型8項基準測試全面超越Meta Muse Glimmer

顯示基準測試比較圖表的筆記型電腦螢幕 / TokenPost.ai

阿里巴巴(BABA)旗下Qwen(通義千問)推出的270億參數(27B)開放權重人工智慧(AI)模型,據報在與Meta(META) Muse Glimmer比較的8項基準測試中全數領先,顯示本地端運行AI模型的競爭焦點正從成本轉向程式撰寫與代理(Agent)任務執行能力。

律動BlockBeats報導援引「動察 Beating」監測資訊指出,Qwen3.8-27B在官方公佈的8項基準測試比較項目中,全面超越Meta 300億參數(30B)模型Muse Glimmer。不過根據Qwen官方部落格與Hugging Face模型卡資訊,目前公開的27B模型正式名稱為Qwen3.6-27B,是一款270億參數規模、內建視覺編碼器的語言模型,並以Apache 2.0授權登錄於Hugging Face平台。

在律動BlockBeats提供的比較數據中,Qwen 27B級模型在Terminal-Bench 2.1測試取得73.0分,Muse Glimmer為51.7分;SWE-bench Pro測試分別為61.7分與51.2分;OSWorld-Verified測試則為84.3分對65.9分。這三項指標分別用於評估終端作業能力、軟體工程問題解決能力,以及電腦操作型代理的執行表現。

報導同時提供與Anthropic旗下Claude Opus 4.6的比較結果。律動BlockBeats指出,在雙方皆有成績的19項測試中,Qwen 27B級模型有15項領先。其中SWE-bench Pro、LiveCodeBench、OSWorld、AndroidWorld及部分視覺任務由Qwen模型佔優,但在Terminal-Bench、GPQA、HLE與NL2Repo等項目則落後於Claude Opus 4.6。

Qwen3.6-27B官方模型卡則列出另一套評分基準。Qwen官方資料顯示,Qwen3.6-27B在SWE-bench Verified測試得分77.2分,SWE-bench Pro得分53.5分,Terminal-Bench 2.0得分59.3分。由於各評測所用的評測工具(harness)與版本不同,不同表格間的分數難以直接視為同一基準下的比較。

Meta的Muse Glimmer此前以可在Mac與PC上運行的開源代理模型形式公開。本報當時報導指出,代理模型是能依使用者指令規劃任務並執行多步驟操作的AI模型。此後,本報也進一步說明了開放權重與開源之間的差異

這次比較的重點不在單純排名,而是本地端AI效能評估標準正在轉變。過去輕量模型多以成本與部署便利性為賣點,但近期的比較已聚焦於修改程式碼儲存庫、執行終端作業、操作螢幕介面等實際開發環境中的執行能力。

目前此事與虛擬資產市場尚無直接關聯。本地AI模型與開放權重模型的競爭,未來可能與去中心化運算、AI驗證、開發者工具等領域產生交集,但這次基準測試對相關代幣價格或交易量造成的直接影響尚未確認。

驗證來源:Qwen官方部落格Qwen3.6-27B Hugging Face模型卡Meta AI開發者頁面

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1