阿里巴巴(BABA)在通義千問4(Qwen4)正式版問世前,預告將於台灣時間8月26日23時(南韓時間8月27日0時)推出採用新一代架構的「通義千問3.8-Flash-Next(Qwen3.8-Flash-Next)」。
根據律動BlockBeat(BlockBeat)報導,模型託管平台魔搭社區(ModelScope)近日上線了通義千問3.8-Flash-Next的預告頁面,發布時間標示為北京時間8月26日晚間11時,換算台灣時間同為23時。
官方介紹指出,這款模型是驅動通義千問4系列的新一代架構「多模態混合專家(MoE)」模型,並非通義千問4正式版本身,而是讓開發者與社群提前檢視新架構的技術預覽版本。
多模態是指模型能同時處理文字與圖像等多種形式的輸入;混合專家架構則不會在每次運算中啟動全部參數,而是依任務需要僅啟用部分「專家」網路,藉此調整大型模型的運算成本與回應速度。
阿里巴巴這次先亮出的是架構本身,而非完整產品線。在通義千問4正式版問世前先公開新架構,被視為是提前打通後續模型系列開發環境與驗證流程的做法。
律動BlockBeat並指出,阿里巴巴此前在通義千問3-Next(Qwen3-Next)中導入了閘控德爾塔網路(Gated DeltaNet)與常規注意力機制結合的混合結構,其後通義千問3.5系列延續了這套設計。這次發布同樣延續「先釋出新架構、再擴展至後續產品線」的路徑。
阿里巴巴的模型公開節奏也受到關注。根據律動BlockBeat報導,阿里巴巴本月稍早才公開參數規模達2.4兆的通義千問3.8-Max(Qwen3.8-Max),不到一個月後便預告推出下一代架構。
本站先前報導,阿里巴巴曾以開源形式公開通義千問3.8系列模型,當時通義千問3.8-27B被介紹為參數規模達270億、原生支援多模態的密集型(Dense)模型。
密集型模型會一致使用所有參數,混合專家模型則選擇性啟動部分專家網路;前者在部署環境上較為單純,後者則在大型模型的運算效率上更具優勢,是業界常拿來比較的兩種設計。
在開源模型生態圈中,開發者除了關注效能指標,也同樣重視授權條款、權重公開方式、推論成本、長文本處理能力,以及是否支援多模態。通義千問3.8-Flash-Next實際採用何種授權、公開哪些權重與提出哪些基準測試成績,須等27日發布後才能確認。
留言 0