螞蟻集團(Ant Group)旗下AI組織inclusionAI發表大型語言模型「Ling-3.0-flash」(靈-3.0-flash),總參數量達1240億,但每個token僅啟動51億參數。據悉,FP8量化版容量僅約BF16版的一半,約為128GB。
律動(BlockBeats)5日報導,Ling-3.0-flash的BF16原始版與FP8量化版皆以MIT授權條款上架至Hugging Face與魔搭(ModelScope),開發者可透過SGLang或vLLM自行部署。律動指出,BF16版容量約255GB,FP8版約128GB。
Ant Ling官方文件將Ling-3.0-flash定位為「專家混合」(Mixture-of-Experts,MoE)模型。專家混合架構會依輸入內容僅呼叫部分專家網路,在維持整體模型規模的同時降低實際運算量。
官方文件指出,該模型預設支援256K上下文窗口,最高可擴展至1M token。文件說明,在高頻任務中,模型以每秒最高1000 token的推論峰值速度、以及低於100毫秒的首token回應時間(TTFT)為目標。
螞蟻集團在7月27日的官方新聞稿中表示,Ling-3.0-flash採用KDA(Kimi Delta Attention)與MLA(Multi-head Latent Attention)層以5比1比例交錯排列的原生混合線性注意力架構。相較上一代,專家啟動比例也從32分之1降至64分之1。
FP8是一種以低於BF16的精度儲存參數,藉此降低權重容量與記憶體用量的格式。若依律動提供的數據,FP8版容量約為BF16版的一半。不過截至5日,Ant Ling官方模型文件雖可查詢總參數、啟動參數與上下文窗口等資訊,但同一份Hugging Face模型卡的可查詢內容有限。
Ant Ling官方價格文件顯示,Ling-3.0-flash自韓國時間7月23日凌晨1時起至8月7日凌晨0時59分59秒止免費開放使用。8月將提供75%折扣,正式價格為每100萬輸入token 0.40元人民幣、每100萬輸出token 1.20元人民幣。
此次發表並未提及與加密貨幣、區塊鏈的直接關聯。若開發團隊計畫在自有伺服器或私有雲上運行代理型(Agentic)AI,建議在實際部署前先確認模型卡、授權檔案與校驗碼。
留言 0