中國小紅書(Xiaohongshu)旗下AI實驗室dots.studio推出開源模型「dots3-note preview」,採用2800億參數規模的MoE(混合專家)架構,並搭載51萬2000 token的超長上下文窗口。
根據PANews的報導,dots.studio於15日將dots3-note preview以開源形式公開。官方公布的實際啟用參數為160億個,模型不僅支援文字,也能處理視覺與音訊輸入。
dots.studio表示,為強化長時間代理(agent)訓練,團隊導入了名為「TEMPO」的強化學習方法。目前模型權重已上傳至Hugging Face,API也已串接至OpenRouter,開發者可直接呼叫使用。
效能數據同步公開。根據SemiAnalysis分享的圖表,dots3-note在Terminal-Bench 2.1測試中取得75.1分,比該圖表中分數最高的美國開源權重模型高出4.9分。
不過SemiAnalysis也提到,目前仍在進行額外測試,以確認模型在日常使用中的表現品質,以及是否存在針對評測本身最佳化的可能性。換句話說,基準測試分數是否等同實際開發環境中的品質,仍有待進一步驗證。
Terminal-Bench團隊在官方資料中說明,Terminal-Bench 2.1是用來評估代理在終端機環境中執行任務能力的基準測試。此版本針對89項任務中的28項進行修訂,主要修正外部依賴變化、資源條件不一致與任務規格錯誤等問題。
MoE是一種只啟用部分專家模型、藉此提升運算效率的架構,能在不動用全部參數的情況下,針對特定任務選擇性調動所需資源。而長上下文窗口則有助於一次處理長文件、程式碼庫或對話紀錄。
近期AI模型評測的重心,正從單純的問答能力轉向實際任務執行能力。本報先前也曾報導,評估終端機任務與軟體工程問題解決能力的基準測試已成為比較開源模型的重要指標。
此次公開的意義,與其說是關乎加密貨幣市場本身,不如說更接近AI開發基礎建設的範疇。不過由於OpenRouter是將多款AI模型整合在單一API下提供服務的平台,開發者與研究人員又多了一個比較、實驗開源權重模型的管道。實際服務品質與後續反覆評測結果,預料將在SemiAnalysis的追加測試中進一步呈現。
留言 0