Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

免費模型達58個,輝達擴大AI開發者版圖

擺放著GPU顯示卡與筆記型電腦的工作桌 / TokenPost.ai

輝達(NVIDIA,NVDA)近來以開放式AI模型與免費推論API,持續擴大與開發者的接觸面。外界解讀,這是先讓開發者試用模型,再引導其走向以輝達GPU為基礎的部署環境的策略。

輝達於8月11日在官方部落格公開了Nemotron 3.5 Lightning。這款模型採用「混合專家」(MoE)架構,總參數量達300億,啟用參數則為30億。

「混合專家」架構的運作方式,是針對每次輸入僅啟用部分專家模型,藉此降低運算量。Nemotron 3.5 Lightning鎖定長文本處理與「代理型AI」(agentic AI)任務,最高可支援100萬個token的上下文。

這款模型可透過Hugging Face與輝達NGC下載。Hugging Face的模型頁面上標註了8月11日發布、採用OpenMDW 1.1授權,並註明可用於商業用途。

輝達NGC說明,該容器提供與OpenAI相容的API,可用於AI代理、聊天機器人、檢索增強生成(RAG)與程式協助等用途。開發者可直接測試模型權重、部署容器與推論API。

以台灣時間8月25日確認為準,輝達模型頁面共列出126款模型,其中提供「免費端點」的有58款,可下載的模型則有102款。

同一頁面也一併介紹了供開發測試用的免費無伺服器API,以及輝達NIM推論微服務。免費API主要用於初期實驗與效能比較,NIM則對應實際部署階段的推論服務架構。

這波動作延續了本媒體先前報導的輝達公開Nemotron 3.5消息。輝達不僅推出大型推論模型,也同步整合輕量執行層模型與路由工具。

同日發布的NeMo Switchyard,是一套協助依任務性質分派模型的開源路由函式庫。輝達在技術部落格中表示,這項工具會綜合考量模型效能、成本與基礎設施訊號來分配任務。

相較於一問一答的聊天機器人,「代理型AI」往往需要反覆執行多階段任務。比起把所有請求都交給大型模型處理,將重複性作業交由輕量模型執行、僅將複雜判斷送往大型模型,是業界用來降低成本與延遲的常見做法。

輝達稍早已於6月4日公開Nemotron 3 Ultra。這是一款大型MoE模型,總參數量達5500億,啟用參數為550億。

官方資料指出,Nemotron 3 Ultra可支援最高100萬token的上下文,並適用於長時間的代理型任務。相對而言,Nemotron 3.5 Lightning則被定位為在較小的執行層中,快速處理特定任務的模型。

軟體層面也同步擴充。輝達技術部落格表示,Dynamo 1.0在以Blackwell為基礎的環境中,可將請求處理量最高提升7倍。

該數據是以3月3日更新的SemiAnalysis InferenceX基準測試為依據。輝達透過同時提供模型、容器與推論最佳化軟體,打造出讓開發者能在自家硬體環境中驗證效能的架構。

輝達的免費模型策略,為以封閉式API為主的AI開發模式提供了另一種選項。不過,實際能帶來多少成本節省或GPU需求成長效果,仍須視各企業的部署環境、使用量與硬體配置而定。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1