AI編碼工具Cursor的「專家混合」(Mixture-of-Experts,MoE)模型訓練技術傳出新進展,據稱在輝達(NVDA)GB300 GPU 512顆的環境中,整體「處理量」提升了41%。作法是讓GPU之間的資料傳輸與運算「重疊執行」,藉此降低訓練過程中的瓶頸。
根據中國監控頻道「動察Beating」5日的報導,Cursor公開了用於MoE模型訓練的開源核心「Mixture-of-Kittens」(MoK)。報導同時指出,在單一MoE層的測試中,效能最高可達現有公開替代方案的2.37倍。
「MoE」是在同一個模型內設置多組專家網路、依輸入內容只呼叫其中一部分的架構,優點是能在控制運算量的同時擴大模型規模。不過當各專家分散在不同GPU上時,資料搬移與運算等待的時間也會隨之增加。這次傳出的技術重點,就是把原本分開處理的資料傳輸與運算,整合進同一個核心裡同步進行,藉此縮短等待時間。
值得留意的是,截至發稿為止,Cursor官方部落格與公開GitHub儲存庫中,都尚未看到同名的正式發表內容。41%與2.37倍這兩項數字,目前僅來自「動察Beating」的報導,實際程式碼、詳細實作方式與可重現的測試結果都還沒有公開,這部分仍有待Cursor官方進一步確認。
Cursor先前在2025年8月發布的MXFP8核心相關文章中曾提到,透過在核心層級重寫Blackwell GPU專用的MoE層,讓該層效能提升3.5倍、整體訓練速度提升1.5倍。當時MoE層分別占用了前向傳播時間的53%與反向傳播時間的27%。
另外在《Composer 2技術報告》中,Cursor也把以Blackwell GPU為基礎的低精度核心、非同步強化學習流程,以及大規模沙盒執行環境,列為訓練基礎設施的核心要素。在warp decode相關技術文章裡,Cursor則說明透過重新設計MoE推論路徑,在Blackwell上將處理量提升了1.84倍。
這項技術本身與特定代幣或區塊鏈事件沒有直接關聯,但對仰賴AI代理與程式碼自動化工具的區塊鏈相關企業而言,訓練基礎設施的成本與效能表現,仍可能是需要留意的技術變數。
從硬體面來看,大規模高效能GPU叢集是支撐這類技術的核心基礎。輝達說明,其GB300 NVL72將72顆Blackwell Ultra GPU與36顆Grace CPU整合為單一機櫃規模的平台。
留言 0