General Compute將推動同時採用輝達(NVIDIA, $NVDA) GPU與Cerebras專用晶片的AI推理基礎設施,並把輸入處理與答案生成分配給不同晶片,以支援代理型AI工作。
Crypto Briefing報導,General Compute計畫讓Cerebras晶圓級晶片與現有GPU並行運作,目標在2027年第1季啟用面向客戶的運算容量,首個應用領域可能是代理型程式編碼工作。
General Compute在官方網站提出,負責一次處理完整提示的「prefill」由GPU執行,依序生成代幣的「decode」則由Cerebras與SambaNova等專用晶片負責。公司目前將Cerebras CS-3列為「Shipping now」產品。
Prefill是平行處理長篇輸入上下文的階段,容易受到運算效能影響;decode則是逐一生成答案代幣的階段,因此記憶體頻寬與資料傳輸速度相當重要。
General Compute在8月白皮書中表示,decode是僅靠GPU運算效能難以解決的瓶頸。白皮書介紹,Cerebras晶圓級引擎會把模型權重配置在晶片內部的SRAM,以減少存取外部記憶體。
General Compute主張,這種方式適合重視個別使用者代幣生成速度的代理型工作。代理型AI在回應使用者要求時,可能連續進行多次推理,因此答案生成延遲被視為重要效能因素。
Cerebras也曾公開採用專用晶片的分離式推理策略。Cerebras在6月簡報中提出,由AWS Trainium晶片處理prefill,再由Cerebras CS-3負責decode。
Cerebras在同一份簡報中表示,已與OpenAI簽訂規模達750MW的推理運算部署合約。這反映出業界正依照工作特性分配運算資源,而非以單一晶片體系同時處理訓練與推理。
General Compute正推動將多種專用晶片部署在現有資料中心與共置設施,讓客戶透過單一合約使用運算容量。公司網站列出的產品組合包括Cerebras、SambaNova、Positron、d-Matrix與輝達B300。
公司也在進行融資。General Compute在7月從Upper90取得最高4億美元(約5436億韓元)的債務融資;TechCrunch當時報導,資金將用於擴大以SambaNova SN50為基礎的推理雲。
TechCrunch也補充,這是將推理專用晶片作為金融抵押品的案例。不過,目前尚未公開這次融資是否直接用於購買Cerebras晶片。
General Compute與加密貨幣產業也存在交集。General Compute執行長Finn Puklowski在5月接受TechCrunch訪問時表示,比特幣(BTC)挖礦業者正考慮將現有設施轉型為AI資料中心。
目前尚未確認此次導入Cerebras是否與特定挖礦業者或國內業者有關。General Compute公開的商業模式是在資料中心與共置設施部署多種晶片,但尚未提出按客戶區分的部署時程。
作為採用專用晶片的AI推理基礎設施案例,先前也曾介紹過運用Cerebras晶圓級推理的架構。當時同樣提出依照工作類型分別使用Cerebras與GPU的方式。
Cerebras在另一項將CS-4介紹為推理中心系統的案例中,也強調晶片內部記憶體與低延遲。不過,產品效能與業務擴張性仍須一併確認實際供應穩定性、模型相容性與營運成本後才能判斷。
General Compute表示,面向客戶的運算容量目標在2027年第1季啟用。Cerebras晶片的實際採購數量、合約金額與按客戶區分的部署時程目前均未公開。
留言 0