輝達(NVIDIA,NVDA)正式啟動低延遲AI推理加速器「Groq 3 LPX」機架系統的全面量産。Nebius(NBIS)成為首家導入的業者,預計今年底就會在自家資料中心提供給開發者使用。
輝達於24日(當地時間)在官方部落格表示,「Groq 3 LPX」是用來擴展「Vera Rubin」平台推理效能的機架級系統。輝達說明,在Gemma 4 31B的基準測試中,以10萬token的長文本情境作業為準,系統每秒可處理3400個輸出token。
「Groq 3 LPX」採用每機架連接256顆LPU加速器的架構。輝達在3月的技術部落格中介紹,這套系統整體搭載128GB的晶片內建SRAM,並具備315 petaFLOPS(PFLOPS)等級的FP8推理運算效能。
輝達表示,「Groq 3 LPX」將與「Vera Rubin NVL72」搭配使用,主要鎖定對回應延遲敏感的AI服務,例如對話型代理人與程式撰寫系統,用意在提升token生成速度。
留言 0