Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

GPU與Cerebras並行:General Compute目標2027年第1季啟用

GPU加速器與晶圓級晶片/TokenPost.ai

General Compute將推動同時採用輝達(NVIDIA, $NVDA) GPU與Cerebras專用晶片的AI推理基礎設施,並把輸入處理與答案生成分配給不同晶片,以支援代理型AI工作。

Crypto Briefing報導,General Compute計畫讓Cerebras晶圓級晶片與現有GPU並行運作,目標在2027年第1季啟用面向客戶的運算容量,首個應用領域可能是代理型程式編碼工作。

General Compute在官方網站提出,負責一次處理完整提示的「prefill」由GPU執行,依序生成代幣的「decode」則由Cerebras與SambaNova等專用晶片負責。公司目前將Cerebras CS-3列為「Shipping now」產品。

Prefill是平行處理長篇輸入上下文的階段,容易受到運算效能影響;decode則是逐一生成答案代幣的階段,因此記憶體頻寬與資料傳輸速度相當重要。

General Compute在8月白皮書中表示,decode是僅靠GPU運算效能難以解決的瓶頸。白皮書介紹,Cerebras晶圓級引擎會把模型權重配置在晶片內部的SRAM,以減少存取外部記憶體。

General Compute主張,這種方式適合重視個別使用者代幣生成速度的代理型工作。代理型AI在回應使用者要求時,可能連續進行多次推理,因此答案生成延遲被視為重要效能因素。

Cerebras也曾公開採用專用晶片的分離式推理策略。Cerebras在6月簡報中提出,由AWS Trainium晶片處理prefill,再由Cerebras CS-3負責decode。

Cerebras在同一份簡報中表示,已與OpenAI簽訂規模達750MW的推理運算部署合約。這反映出業界正依照工作特性分配運算資源,而非以單一晶片體系同時處理訓練與推理。

General Compute正推動將多種專用晶片部署在現有資料中心與共置設施,讓客戶透過單一合約使用運算容量。公司網站列出的產品組合包括Cerebras、SambaNova、Positron、d-Matrix與輝達B300。

公司也在進行融資。General Compute在7月從Upper90取得最高4億美元(約5436億韓元)的債務融資;TechCrunch當時報導,資金將用於擴大以SambaNova SN50為基礎的推理雲。

TechCrunch也補充,這是將推理專用晶片作為金融抵押品的案例。不過,目前尚未公開這次融資是否直接用於購買Cerebras晶片。

General Compute與加密貨幣產業也存在交集。General Compute執行長Finn Puklowski在5月接受TechCrunch訪問時表示,比特幣(BTC)挖礦業者正考慮將現有設施轉型為AI資料中心。

目前尚未確認此次導入Cerebras是否與特定挖礦業者或國內業者有關。General Compute公開的商業模式是在資料中心與共置設施部署多種晶片,但尚未提出按客戶區分的部署時程。

作為採用專用晶片的AI推理基礎設施案例,先前也曾介紹過運用Cerebras晶圓級推理的架構。當時同樣提出依照工作類型分別使用Cerebras與GPU的方式。

Cerebras在另一項將CS-4介紹為推理中心系統的案例中,也強調晶片內部記憶體與低延遲。不過,產品效能與業務擴張性仍須一併確認實際供應穩定性、模型相容性與營運成本後才能判斷。

General Compute表示,面向客戶的運算容量目標在2027年第1季啟用。Cerebras晶片的實際採購數量、合約金額與按客戶區分的部署時程目前均未公開。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1