Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

AI模型KV快取通訊延遲降2.5倍

實驗室中相互連接的AI加速器卡/TokenPost.ai

大型語言模型(LLM)之間如今可直接交換內部狀態KV快取,不必先轉成文字。清華大學研究團隊表示,這項通訊方式讓模型間平均通訊延遲時間較既有文字傳輸方式縮短2.5倍。

研究團隊提出的「Cache-to-Cache(C2C)」架構,會先將一個模型的KV快取轉換至另一個模型的表示空間,再進行融合。相關論文於2025年10月3日首次公開,並於2026年3月2日修訂,現已列入國際學習表徵會議(ICLR)2026論文。

在既有的多模型LLM系統中,一個模型通常先將分析結果生成文字,再由另一個模型重新讀取。這個過程會把模型內部的高維資訊壓縮成句子,並因逐一生成代幣而增加延遲。

C2C會透過神經網路「Cache Fuser」,將提供資訊的「Sharer」模型KV快取投影至「Receiver」模型的快取中。可訓練閘門則負責選擇應將資訊傳遞至Receiver的哪些層。

KV快取是模型處理先前輸入時累積的鍵和值形式內部狀態。隨著上下文變長,快取容量也會增加,進而影響推理速度與記憶體用量,現已成為長文本推理基礎設施的重要組成部分。

研究團隊以Qwen2.5、Qwen3、Llama3.2與Gemma3等多個模型系列進行測試,模型規模涵蓋0.6B至14B,並採用OpenBookQA、MMLU-Redux、ARC-Challenge與C-Eval等基準測試。

實驗結果顯示,C2C的平均準確率較單一模型高出6.4%至14.2%;與文字式模型通訊相比,準確率也提升3.1%至5.4%。

平均延遲時間則較文字通訊方式縮短2.5倍。研究團隊表示,這項架構不需生成中間說明文字,而是直接傳遞模型內部表示,因此可減少資訊損失與序列生成延遲。

論文指出,KV快取不只是計算用的暫存空間,也可能成為模型間傳遞語意的媒介。即使處理相同輸入,不同模型累積的上下文與知識表徵仍可能不同,將兩者結合後,有機會補足單一模型遺漏的資訊。

不過,效能提升並非在所有情境下都能保證。研究團隊表示,若Sharer模型傳遞錯誤資訊,Receiver可能反而答錯原本能獨立答對的問題。當強大的Receiver搭配較弱的Sharer時,這類失敗的可能性也會提高。

擴展性同樣仍是挑戰。目前C2C主要採用針對不同模型組合分別訓練投影器與融合器的成對架構。若要讓多個模型同時通訊,則需要建立共同潛在空間。

論文也提出面向多模型的統一潛在空間方案,但將其定位為初步實驗階段的方法。隨著模型組合增加,融合器的訓練成本,以及通訊過程中的錯誤,都需要同步管理。

實驗結果是在單一NVIDIA A100 GPU、有限回應長度及研究團隊指定模型組合下測得。因此,若要將結果延伸至實際服務環境中的成本、處理量、安全性與錯誤傳播程度,仍需進一步驗證。

官方程式碼已在GitHub以Apache-2.0授權公開,儲存庫包含部分模型組合可使用的預訓練融合器,以及訓練與評估範例。不過,C2C目前並非可立即套用於所有模型組合的通用通訊標準。

這項研究的意義在於,中國研究團隊提出了改變AI模型間通訊結構的方法。但就目前確認的研究範圍來看,論文尚未提出商業服務導入方案,也未顯示其與虛擬資產、區塊鏈或半導體產業存在直接關聯。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1