IBM發布開放權重語言模型Granite 4.2三款版本,主打企業代理(agent)任務效能,其中30億參數版本在同規模的46款開放權重模型獨立評測中位居第二。
IBM研究院於25日(美東時間)表示,推出30億、80億、300億三種參數規模的Granite 4.2。三款模型均以Apache 2.0授權釋出,具備可調整的推理深度與工具呼叫(tool calling)功能。
使用者可設定模型在回答前進行完整推理,或僅執行低強度推理,也能選擇跳過推理直接作答。IBM將此定位為讓企業依速度與準確度需求彈性選擇的功能。
這次發布中最受矚目的是小型模型的表現。評測機構Artificial Analysis給予Granite 4.2 30億參數模型14分的智慧指數(Intelligence Index),高於同規模開放權重模型群組中位數的4分。
Granite 4.2 80億參數模型在同一評測中拿下20分,同規模模型群組中位數為9分。這顯示產業競爭已不只侷限於擴大參數規模,企業實際可部署小型模型的效率提升也成為焦點。
IBM將Granite 4.2的重點放在企業代理任務上。所謂代理,是指AI不僅止於生成單一答案,而是在程式碼儲存庫、終端機、搜尋環境中執行多步驟作業的使用方式,由模型自行判斷該用哪些工具、依何種順序執行,並根據執行結果決定下一步動作。
IBM研究院說明,80億與300億參數模型另外經過涵蓋軟體工程、終端機操作與搜尋任務的代理強化學習訓練,30億參數模型則未套用此階段。三款模型皆完成基礎強化學習與對齊訓練,但實際在沙盒環境中透過工具實作學習的,僅有80億與300億參數版本。
在IBM自行公布的評測中,大型模型同樣在程式碼與推理指標上領先。Granite 4.2 300億參數模型在SWE-Bench Verified測試中取得57.00%,在AIME25測試中取得89.17%;80億參數模型則分別為47.67%與86.67%。
30億參數模型在AIME25測試中取得78.33%,在BFCL v4測試中取得52.41%。SWE-Bench Verified用於衡量軟體錯誤修復能力,AIME25用於評估數學推理能力,BFCL則是測試函式呼叫與工具使用能力的指標。
技術架構也有所調整。根據Hugging Face公布的技術說明,Granite 4.2被定位為密集型(dense)僅解碼器(decoder-only)推理模型系列。三款模型皆以約15兆token進行預訓練,並全數支援推理模式切換與原生工具呼叫功能。
開放權重模型指使用者可下載模型權重、自行執行或調整的AI模型。對企業而言,這意味著不必完全依賴封閉式API,可依自身基礎設施、資安政策與成本結構彈性運用模型。本刊此前也曾報導開放權重AI模型正逐漸成為企業AI基礎設施策略的一環。
對台灣企業與開發者而言,授權條件同樣是重要考量。Apache 2.0授權廣泛允許商業使用與修改後散布,IBM表示Granite 4.2設計時即考量雲端、地端與邊緣(edge)環境的部署需求。
不過,獨立評測與IBM自家評測並非在相同基準下進行,實際應用表現仍須由各企業依自身數據、資安要求與營運環境個別驗證。開放權重模型的競爭焦點,正從參數規模比拼轉向能否穩定處理真實業務需求。
留言 0