Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

1億美元種子輪:Callosum攜手Cerebras布局客製化AI推論

實驗室中的AI加速器主機板/TokenPost.ai

AI新創Callosum宣布完成1億美元種子輪融資,並將「Cerebras Systems($CBRS)」列為全球運算合作夥伴,核心策略是依金融、資安、企業AI等任務性質分別配置模型與晶片,稱為「Tailored Inference(客製化推論)」。

Callosum於20日發布聲明指出,本輪由Atomico領投,Plural、DCVC及英國主權AI基金也參與投資。公司形容與Cerebras的合作是「以超低延遲的異質多代理智慧、大規模提供給客戶的旗艦夥伴關係」。

這項合作是為了跳脫「單一模型加單一GPU叢集處理所有AI任務」的舊模式。Callosum表示,對延遲最敏感的判斷會交給Cerebras的晶圓級推論處理,成本考量較高的任務則改用非同步GPU搭配其他模型組合。

「Tailored Inference」的做法是依任務性質規劃不同的推論路徑。理由是大型語言模型(LLM)實際導入業務時,除了準確度,回應延遲、呼叫成本與運營穩定性都必須一併考慮,並非所有請求都適合用同一套基礎設施處理。

根據Callosum公布的Tailored Inference資料,採用Cerebras架構的配置可在0.28秒內完成對延遲敏感的判斷;均衡型配置則需0.53秒、每次呼叫成本0.34美元。公司以此數據主張,這樣的成本與速度組合可讓即時監控套用到每一次呼叫上。

不過,這些數字目前僅是Callosum自行公布的基準測試(benchmark),尚未見到外部驗證結果或個別客戶的實際成本結構,導入後的實際效果仍會因應用場景與呼叫規模而異。

Callosum同時公開了一項金融自動化案例。據其說法,客戶Round Treasury在發票與收據文件擷取作業上,平均處理時間從15.9秒縮短到2.1秒,複雜案例最高可加快20倍。

Round Treasury共同創辦人Hayyaan Ahmad表示:「文件現在能即時顯示在儀表板上,而不是在背景默默處理。」這句話說明的是,低延遲推論被用來加速財務團隊的重複性文件作業。

Cerebras本身也將金融服務視為低延遲AI的重點應用領域。該公司在其金融服務頁面說明,AI可用於金融預測、詐欺偵測、客服與演算法交易及其管理,並強調大規模資料與低延遲在這類應用中的重要性。

Cerebras擴大推論基礎設施的動作,先前也曾出現在與「超微(AMD)」的合作中。Cerebras與AMD於7月23日宣布技術合作,計劃把AMD Helios與Cerebras的晶圓級引擎整合成單一分離式推論工作流程。

兩家公司表示,這項架構預計於2026年下半年率先在Cerebras Cloud提供,屬雙方聯合聲明中的既定時程,而非市場臆測。Callosum這次的發布,正好呼應了Cerebras從單純硬體供應商轉型為夥伴型推論基礎設施提供者的走向。

對台灣讀者而言,這則新聞的重點不在加密貨幣價格波動,而在AI基礎設施成本結構的變化——如何在延遲、成本與準確度之間取捨,正成為企業導入LLM時的關鍵課題。

評論:目前能確認的核心數字與應用案例,全部來自Callosum自身公布的資料;Cerebras官方新聞稿列表中並未單獨提及Callosum這項合作,實際導入成本與外部驗證後的效能表現,仍待雙方後續公開更多資訊才能判斷。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1