大型語言模型(LLM)之間如今可直接交換內部狀態KV快取,不必先轉成文字。清華大學研究團隊表示,這項通訊方式讓模型間平均通訊延遲時間較既有文字傳輸方式縮短2.5倍。
研究團隊提出的「Cache-to-Cache(C2C)」架構,會先將一個模型的KV快取轉換至另一個模型的表示空間,再進行融合。相關論文於2025年10月3日首次公開,並於2026年3月2日修訂,現已列入國際學習表徵會議(ICLR)2026論文。
在既有的多模型LLM系統中,一個模型通常先將分析結果生成文字,再由另一個模型重新讀取。這個過程會把模型內部的高維資訊壓縮成句子,並因逐一生成代幣而增加延遲。
C2C會透過神經網路「Cache Fuser」,將提供資訊的「Sharer」模型KV快取投影至「Receiver」模型的快取中。可訓練閘門則負責選擇應將資訊傳遞至Receiver的哪些層。
KV快取是模型處理先前輸入時累積的鍵和值形式內部狀態。隨著上下文變長,快取容量也會增加,進而影響推理速度與記憶體用量,現已成為長文本推理基礎設施的重要組成部分。
研究團隊以Qwen2.5、Qwen3、Llama3.2與Gemma3等多個模型系列進行測試,模型規模涵蓋0.6B至14B,並採用OpenBookQA、MMLU-Redux、ARC-Challenge與C-Eval等基準測試。
實驗結果顯示,C2C的平均準確率較單一模型高出6.4%至14.2%;與文字式模型通訊相比,準確率也提升3.1%至5.4%。
平均延遲時間則較文字通訊方式縮短2.5倍。研究團隊表示,這項架構不需生成中間說明文字,而是直接傳遞模型內部表示,因此可減少資訊損失與序列生成延遲。
論文指出,KV快取不只是計算用的暫存空間,也可能成為模型間傳遞語意的媒介。即使處理相同輸入,不同模型累積的上下文與知識表徵仍可能不同,將兩者結合後,有機會補足單一模型遺漏的資訊。
不過,效能提升並非在所有情境下都能保證。研究團隊表示,若Sharer模型傳遞錯誤資訊,Receiver可能反而答錯原本能獨立答對的問題。當強大的Receiver搭配較弱的Sharer時,這類失敗的可能性也會提高。
擴展性同樣仍是挑戰。目前C2C主要採用針對不同模型組合分別訓練投影器與融合器的成對架構。若要讓多個模型同時通訊,則需要建立共同潛在空間。
論文也提出面向多模型的統一潛在空間方案,但將其定位為初步實驗階段的方法。隨著模型組合增加,融合器的訓練成本,以及通訊過程中的錯誤,都需要同步管理。
實驗結果是在單一NVIDIA A100 GPU、有限回應長度及研究團隊指定模型組合下測得。因此,若要將結果延伸至實際服務環境中的成本、處理量、安全性與錯誤傳播程度,仍需進一步驗證。
官方程式碼已在GitHub以Apache-2.0授權公開,儲存庫包含部分模型組合可使用的預訓練融合器,以及訓練與評估範例。不過,C2C目前並非可立即套用於所有模型組合的通用通訊標準。
這項研究的意義在於,中國研究團隊提出了改變AI模型間通訊結構的方法。但就目前確認的研究範圍來看,論文尚未提出商業服務導入方案,也未顯示其與虛擬資產、區塊鏈或半導體產業存在直接關聯。
留言 0