輝達(NVIDIA,NVDA)近來以開放式AI模型與免費推論API,持續擴大與開發者的接觸面。外界解讀,這是先讓開發者試用模型,再引導其走向以輝達GPU為基礎的部署環境的策略。
輝達於8月11日在官方部落格公開了Nemotron 3.5 Lightning。這款模型採用「混合專家」(MoE)架構,總參數量達300億,啟用參數則為30億。
「混合專家」架構的運作方式,是針對每次輸入僅啟用部分專家模型,藉此降低運算量。Nemotron 3.5 Lightning鎖定長文本處理與「代理型AI」(agentic AI)任務,最高可支援100萬個token的上下文。
這款模型可透過Hugging Face與輝達NGC下載。Hugging Face的模型頁面上標註了8月11日發布、採用OpenMDW 1.1授權,並註明可用於商業用途。
輝達NGC說明,該容器提供與OpenAI相容的API,可用於AI代理、聊天機器人、檢索增強生成(RAG)與程式協助等用途。開發者可直接測試模型權重、部署容器與推論API。
以台灣時間8月25日確認為準,輝達模型頁面共列出126款模型,其中提供「免費端點」的有58款,可下載的模型則有102款。
同一頁面也一併介紹了供開發測試用的免費無伺服器API,以及輝達NIM推論微服務。免費API主要用於初期實驗與效能比較,NIM則對應實際部署階段的推論服務架構。
這波動作延續了本媒體先前報導的輝達公開Nemotron 3.5消息。輝達不僅推出大型推論模型,也同步整合輕量執行層模型與路由工具。
同日發布的NeMo Switchyard,是一套協助依任務性質分派模型的開源路由函式庫。輝達在技術部落格中表示,這項工具會綜合考量模型效能、成本與基礎設施訊號來分配任務。
相較於一問一答的聊天機器人,「代理型AI」往往需要反覆執行多階段任務。比起把所有請求都交給大型模型處理,將重複性作業交由輕量模型執行、僅將複雜判斷送往大型模型,是業界用來降低成本與延遲的常見做法。
輝達稍早已於6月4日公開Nemotron 3 Ultra。這是一款大型MoE模型,總參數量達5500億,啟用參數為550億。
官方資料指出,Nemotron 3 Ultra可支援最高100萬token的上下文,並適用於長時間的代理型任務。相對而言,Nemotron 3.5 Lightning則被定位為在較小的執行層中,快速處理特定任務的模型。
軟體層面也同步擴充。輝達技術部落格表示,Dynamo 1.0在以Blackwell為基礎的環境中,可將請求處理量最高提升7倍。
該數據是以3月3日更新的SemiAnalysis InferenceX基準測試為依據。輝達透過同時提供模型、容器與推論最佳化軟體,打造出讓開發者能在自家硬體環境中驗證效能的架構。
輝達的免費模型策略,為以封閉式API為主的AI開發模式提供了另一種選項。不過,實際能帶來多少成本節省或GPU需求成長效果,仍須視各企業的部署環境、使用量與硬體配置而定。
留言 0