Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

馬斯克再指AI瓶頸:記憶體需求年增恐逾200%

手持1美元鈔票的伊隆·馬斯克(Elon Musk) / TokenPost.Ai

AI基礎設施的瓶頸正從圖形處理器(GPU)的運算效能,轉向記憶體供應能力,這樣的診斷再度浮上檯面。分析指出,AI代理若要執行長時間任務,必須不斷儲存並重新讀取先前的對話脈絡與工作紀錄,這會讓高頻寬記憶體(HBM)與NAND快閃記憶體的需求壓力持續增加。

伊隆·馬斯克(Elon Musk)是SpaceX執行長,他在XPRIZE創辦人彼得·戴曼迪斯(Peter H. Diamandis)於社群平台X發布的貼文下方回覆「幾乎沒有人知道這件事」。戴曼迪斯在原貼文中表示,AI代理時代真正的速度限制因素不是運算能力,而是記憶體。

馬斯克這次的回應,是AI記憶體需求恐年增逾200%這項先前診斷的延伸。他在SpaceX第二季財報電話會議上曾表示,記憶體產能的年增率約在20%左右,需求年增率卻可能超過200%。

當時這番發言凸顯出,在AI資料中心擴建競賽中,記憶體供應已和GPU一樣重要。隨著AI模型規模與推論用量同步增加,不只運算裝置吃緊,用來存放脈絡資料的儲存裝置也面臨瓶頸。

技術層面的核心議題是「KV快取」(KV Cache)。大型語言模型在處理輸入的權杖(token)時,會產生記錄脈絡關係的鍵值(Key-Value)資料,並將其存入記憶體。有了這筆資料,模型才能延續先前的脈絡繼續運算,而不必每次都從頭重新計算。

一般對話型聊天機器人單次問答的長度相對較短,但AI代理卻要連續執行編碼、搜尋、分析等多階段任務,過程中必須不斷讀取先前的判斷與工作紀錄。當需要儲存的脈絡愈來愈龐大,單靠GPU內建的HBM就難以負荷。

輝達(NVIDIA·NVDA)今年在CES上發表了「Inference Context Memory Storage Platform」推論情境記憶體儲存平台。輝達在相關資料中指出,將KV快取分散配置在GPU的HBM、系統記憶體、SSD與共用儲存等不同層級,可讓長脈絡與代理型推論的每秒權杖處理量與電力效率,較傳統儲存架構最多提升五倍。

這套架構讓AI晶片競爭的焦點變得更廣。過去業界關注的重點主要是GPU的運算效能與供貨量,但在代理型推論當中,脈絡資料儲存在哪裡、又能多快被讀取出來,將直接左右成本與處理量。

微軟(Microsoft·MSFT)強調AI推論加速器Maia 200成本效益的做法,反映的正是同樣的問題意識。生成式AI服務在推論階段的重複性成本往往高於訓練階段,因此處理量與電力效率的提升,會直接反映在營運成本上。

集邦科技(TrendForce)在7月21日發布的NAND快閃記憶體月報中指出,受AI需求推升及擴產有限影響,2026年NAND市場將呈現供不應求。集邦科技估計,2026年NAND供給缺口約落在4%至5%,並分析伺服器將占整體NAND位元需求的40%以上。

集邦科技認為,供給吃緊的情況可能要到2027年下半年才會緩解。這意味著AI基礎設施的擴張,不只牽動短期需求,也牽動記憶體廠商的擴產速度與長期供貨合約條件。

三星電子與SK海力士的HBM、NAND供應策略,和市場動向也有直接關聯。SK海力士在7月29日的第二季財報電話會議上表示,AI基礎設施投資擴大加上供給吃緊,帶動需求持續穩健。

不過,記憶體產業的獲利前景並非單靠需求增加就能決定。長期供貨合約價格、中國廠商的擴產速度,以及資料中心投資步調,都可能左右供給短缺的程度與獲利表現。業界評論認為,這些變數才是觀察記憶體循環能否延續的關鍵。

AI代理的普及,正把半導體需求的重心從GPU逐漸擴大到記憶體與儲存層級。馬斯克這次的發言雖未提出新數據,但可視為AI基礎設施投資中「記憶體瓶頸」再度受到關注的訊號。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1