美國AI新創公司Liquid AI推出參數量約26.9億的端側代理(agent)模型「LFM2.5-2.6B」。在Liquid AI自行公布的測試結果中,部分指令遵循與工具使用分數,超越了參數規模達90億的Qwen3.5-9B。
Liquid AI於4日(當地時間)透過官方部落格宣布,將LFM2.5-2.6B與基礎模型「LFM2.5-2.6B-Base」一併公開於Hugging Face。這款小型模型的設計目標,是讓工具呼叫、多步驟任務與結構化輸出都能直接在本地裝置上完成。
LFM2.5-2.6B以約34兆個token進行預訓練,並經過128K文本長度擴展階段,最長可支援13萬1072個token的上下文。模型架構共有30層,詞彙量規模約12萬8000個。
這款模型是在實際的代理框架(agent harness)中,學習工具使用、系統提示與多輪任務情境。所謂代理框架,是指讓模型能夠選擇並呼叫外部工具、接收執行結果,再據此完成下一步任務的運作環境。
訓練過程結合了監督式微調、教師模型專項訓練、多領域同策略蒸餾(on-policy distillation),以及代理強化學習。蒸餾指的是利用高效能模型的回答與判斷,將能力轉移給規模較小模型的技術。
Liquid AI說明,團隊先針對指令遵循、數學、知識、程式碼、工具使用、長文本處理等領域,分別打造專屬教師模型,再將這些能力整合進單一學生模型。由於推論可直接在裝置端完成、不需經過雲端API,有助於降低延遲並減輕個資處理負擔。
根據Liquid AI公布的評測表,LFM2.5-2.6B在IFBench的分數為59.17,高於Qwen3.5-9B的56.47;Multi-IF為80.07比62.55;IFStruct則是85.49比78.50。
在測試工具使用能力的ToolSandbox項目中,LFM2.5-2.6B同樣以77.83分優於Qwen3.5-9B的76.44分。不過,這些數字都是Liquid AI自行公布的內部評測結果,目前未有獨立機構在相同條件下重現驗證。
並非所有評測項目都由小模型勝出。在BFCLv4測試中,Qwen3.5-9B得分60.13,高於LFM2.5-2.6B的56.88;AIME25與LiveCodeBenchv6兩項評測,也是Qwen3.5-9B表現較佳。
Liquid AI建議,LFM2.5-2.6B較適合用於工具使用、資料擷取、檢索增強生成(RAG)與長文本處理等任務;至於代理程式撰寫(agent coding)與知識密集型工作則不建議採用。官方也表示,若面對複雜任務或程式碼比重較高的環境,規模更大的模型可能更為合適。
在端側裝置實測中,這款模型於蘋果(AAPL)M5 Max晶片上達到每秒220個token的解碼速度,在超微(AMD)Ryzen AI Max+ 395平台上則為每秒113個token。Liquid AI表示,記憶體用量低於2.5GB,即使在手機上運作,速度也能維持在每秒約30個token左右。
這款模型的推出,延續了可在智慧型手機等裝置內直接運作的小型AI模型持續擴張的趨勢。不過,目前並未公開與特定區塊鏈專案、代幣或交易所的直接整合。
本地代理未來或有機會應用於錢包安全防護或鏈上數據分析工具,但實際能否落地,仍須觀察開發者採用情況與獨立性能驗證結果。目前模型權重與基礎模型版本已在Hugging Face公開。
留言 0