DDN將旗下儲存平台Infinia整合進輝達(NVDA)的推論數據傳輸架構,目標是縮短大型語言模型(LLM)服務中GPU等待數據的時間。
DDN於7月23日在技術部落格中表示,Infinia的NIXL外掛已納入輝達NIXL 1.3版本與Dynamo推論容器。NIXL全稱為「NVIDIA Inference Transfer Library」,是一套在分散式推論環境中,負責處理GPU、CPU、SSD與物件儲存之間數據搬移的函式庫。
此次整合聚焦於AI推論過程中「KV快取」的搬移。KV快取是LLM為重複利用先前對話脈絡而暫存的中間數據,一旦對話變長或多個請求同時湧入,KV快取便會迅速佔用GPU記憶體。輝達Dynamo官方文件指出,將KV快取轉移至GPU記憶體、CPU記憶體、SSD及網路連接儲存,可減少重複運算並降低回應延遲。
過去企業須另行取得儲存外掛,驗證其與已安裝NIXL版本的相容性,還得依不同環境個別維護。自NIXL 1.3版本起,Infinia外掛已納入標準套件,使用者只要安裝NIXL或使用Dynamo容器,再加裝DDN用戶端套件即可。DDN表示,毋須修改應用程式代碼,僅透過設定就能啟用KV快取加速功能。
斯文·奧姆(Sven Oehme) DDN技術長在技術部落格中表示:「DDN Infinia now feeds context to the GPUs directly」,意即Infinia會將上下文數據直接餵給GPU,讓GPU能把更多運算資源用於生成token。不過實際能節省多少成本,仍會依客戶環境與工作負載而不同。評論:這類整合真正的效益,恐怕要等更多實際部署案例出現後才能具體驗證。
開源代碼平台GitHub上的「ai-dynamo/nixl」專案,將NIXL定位為可加速輝達Dynamo等AI推論框架點對點通訊的函式庫,並以外掛架構抽象化CPU、GPU記憶體與檔案、區塊、物件儲存,藉此處理跨儲存層的數據搬移。
這次合作與本站先前報導的AI數據中心儲存與傳輸瓶頸因應趨勢一脈相承。如果說美光(MU)與微芯科技(MCHP)著重提升儲存裝置與連接架構的處理效能,DDN與輝達則是在改善推論過程中,將已儲存的上下文數據送往GPU的路徑。
此次發布並未證實與加密貨幣、區塊鏈有直接關聯。對於仰賴AI運算的加密基礎設施業者而言,GPU使用率與數據中心成本可能是間接的營運變數,但具體影響尚未提出說明。
留言 0