法國新創公司Kog近日提出一套在一般資料中心GPU上加速AI「推理」的方案。這家公司不打算另外研發專用推理晶片,而是同時設計軟體與模型架構,試圖把輝達(NVIDIA,$NVDA)與超微(AMD)的GPU用得更徹底。
科技媒體TechCrunch報導,Kog認為「GPU不適合用於代理型工作流程推理」的說法是一種誤解。Kog創辦人暨執行長蓋爾・德拉洛(Gaël Delalleau)在同一篇報導中表示,「GPU仍有光明的未來」,他認為既有GPU在推理市場還能被用得更久、更深入。
Kog鎖定的問題,是單一使用者請求的回應速度。AI代理(agent)在執行任務時,會依序完成規劃、寫程式碼、測試、修正等步驟,只要其中一個環節的輸出變慢,後續步驟就會跟著延遲,因此單一請求的延遲時間,直接左右整體作業速度。
Kog表示,公司把執行環境(runtime)、GPU核心(kernel)與模型架構整合成單一的延遲最佳化流程,藉此縮小這個瓶頸。相較於多數AI基礎設施競賽聚焦於更大的模型與更多加速器,Kog選擇把重心放在既有資料中心GPU上,設法榨出尚未用盡的效能。
Kog在5月28日公開的「Kog推理引擎(Kog Inference Engine)」技術預覽中提出,在8張超微MI300X GPU的環境下,每個請求可達每秒3000個輸出token;同樣條件下改用8張輝達H200 GPU,數字則是每秒2100個輸出token。測試條件為FP16精度、批次大小(batch size)為1,且未使用推測解碼(speculative decoding)。
這些數字主要來自Kog自家部落格與展示影片。公司官網也以「每個請求每秒3000個token」、「推理速度提升30倍」介紹產品,同時將AI寫程式代理與代理型工作流程列為主要應用場景。
Kog在6月24日於Hugging Face公開另一款模型「Laneformer 2B」。Hugging Face上的說明將這款模型定義為擁有23億個參數、經過指令微調的程式碼模型,並提出HumanEval+ 45.1%、MBPP+ 51.6%的成績。TechCrunch報導中提到的參數量約為20億個,與官方數字略有落差,但雙方都同意這是一款小型程式碼模型。
超微官方「AI DevDay 2026」網頁也介紹了Kog的技術發表內容,將這場議程描述為一套鎖定在超微Instinct GPU上、以每個請求每秒生成2500個token為目標的即時推理架構。Kog在8月發布的LinkedIn貼文中則表示,實機展示曾測得每秒2857個token,這項數字同樣由公司自行提出。
速度數字該怎麼解讀,成了討論焦點。LinkedIn貼文下方除了正面回應,也有人追問比較條件是否一致;另有留言指出,Cerebras曾在更大的模型上做出相近的速度。就算同樣是「每秒token數」,只要模型大小、硬體、批次大小、精度與解碼方式不同,就很難直接拿來比較。
所謂推理,是指訓練完成的AI模型執行回答問題、產生程式碼等任務的過程;token則是模型處理語句時的基本單位。使用者發出一次請求後,模型每秒能輸出多少token,直接關係到聊天機器人、寫程式工具與代理型自動化服務的實際使用體驗。
就市場結構而言,推理效能的競爭並不只取決於晶片本身。GPU取得難度、資料搬移、核心最佳化、模型架構與批次處理方式,彼此環環相扣。這也是Kog特別強調軟體與模型「共同設計」的原因。
對讀者而言,這起案例可以視為代理型AI服務所需推理基礎設施競賽的其中一幕。TokenPost先前也曾報導過縮短GPU等待資料時間的推理基礎設施競賽相關內容。
不過,目前並未證實Kog與任何區塊鏈專案有直接關聯。這篇報導關注的重點,不是代幣發行或區塊鏈整合,而是代理型AI服務所需的低延遲,如何在既有GPU基礎設施上落實。
Kog接下來要證明的,是同一套方法能否走出自家展示,在更大的模型與實際營運環境中同樣奏效。德拉洛在接受TechCrunch採訪時表示,如果能在9月前讓第一個主力模型達到10倍速度,就有機會開始爭取客戶並展開A輪募資(Series A)討論。不過,這仍停留在規畫階段。
留言 0