Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

RTX 5090 240張訓練8B模型:手機CPU每秒生成59.6個Token

智慧型手機與 RTX 5090 顯示卡 / TokenPost.ai

Chutes AI表示,已利用分布於13個國家、30個主機的240張RTX 5090 GPU,訓練出80億參數的人工智慧模型,並讓完成的模型在智慧型手機中央處理器(CPU)上運作。

這項示範於9月28日至29日在加拿大蒙特婁舉行的Exploit Summit公開。Crypto Briefing於9月30日報導了相關內容。

訓練使用的GPU為輝達(NVDA) RTX 5090,共240張。Chutes AI提出的訓練成本約為6,500美元(約880萬韓元),每10億個Token的成本約為11美元(約1萬4,894韓元)。

上述成本是Chutes AI自行計算的數值。在相同訓練條件下,外部機構尚未公開可重現成本與效能的資料。

完成的8B模型在智慧型手機CPU上每秒生成約59.6個Token。Token是人工智慧模型處理句子時使用的基本單位。

一款規模更大的407億5,000萬參數模型使用12GB記憶體,每秒處理26.9個Token。兩項數據均為自行示範結果,未公布智慧型手機型號與詳細測試條件。

核心技術是分散式訓練系統「Parallax」。該系統不租用單一大型GPU叢集,而是連接位於不同地點的硬體,分配訓練工作。

Chutes AI在官方資料中表示,Parallax的設計目標是在彼此未直接連接的異質節點上訓練稀疏混合專家模型。稀疏混合專家模型會從多個專家模型中選擇必要部分進行計算,以降低計算量。

Parallax採用以libp2p為基礎的點對點(P2P)架構,在多個節點間同步資料與工作狀態,降低對特定資料中心的依賴。

在分散式架構中,節點故障與網路延遲可能影響訓練流程。公開資料尚未說明大規模訓練環境如何進行資料完整性驗證與故障應對。

裝置端推論也是此次示範的重點。模型若直接在智慧型手機上執行,可建立不將使用者輸入傳送至雲端伺服器的架構,並應用於隱私保護與離線處理。

不過,各款智慧型手機的發熱、耗電與實際回應延遲等詳細測量數據尚未公開。僅憑每秒Token數,難以判斷實際使用便利性或電池效率。

Chutes AI目前營運Bittensor的無伺服器分散式運算子網路SN64。該公司將Parallax介紹為把原本以模型推論為主的基礎設施延伸至訓練階段的技術。

此次案例被定位為把消費級GPU與分散式虛擬資產基礎設施連結至人工智慧模型訓練的實驗。Chutes AI社群表示,自9月10日起已透過即時儀表板公開訓練Token數量、主機數量與每秒處理量等資訊。

部分使用者關注消費級GPU可能降低人工智慧訓練成本。另一方面,社群貼文也提到RTX 5090的穩定性問題與比較基準不足。

Chutes AI表示,計畫公開完整技術報告與完整模型,但尚未確定公開時間。其在商業服務層級的可重現性、安全性與能源效率,仍需進一步驗證。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1