以太坊共同創辦人維塔利克·布特林(Vitalik Buterin)公開實測結果顯示,當本機 AI 模型的上下文長度超過10萬 token 時,輸出速度降至每秒18至21個 token;短上下文情境則為每秒28至33個 token。
布特林在搭載 AMD Strix Halo 平台的筆電上,透過開源推理框架 llama.cpp 執行 Qwen 3.8 Flash。測試共10次,涵蓋原有提示詞長度、新輸入提示詞長度、生成 token 數量、輸入處理速度與輸出速度。
測試依原有上下文長度分為短上下文與長上下文兩組。原有上下文介於2136至7799 token 的6次測試中,輸出速度為每秒28.07至33.37個 token,最高為每秒33.37個 token,最低為每秒28.07個 token。
原有上下文介於10萬4535至10萬7402 token 的4次測試中,輸出速度為每秒18.42至20.78個 token,與短上下文相比約低3至4成。
輸入處理速度也會隨上下文長度變化。短上下文組除了1次例外,速度介於每秒300至373個 token;長上下文組則降至每秒150至198個 token。
短上下文組的例外值為每秒109.82個 token。該次測試的原有提示詞長度為2136 token,新輸入提示詞長度為110 token。
token 是 AI 模型處理與生成句子的基本單位。上下文長度則代表模型一次能參考的輸入資訊範圍;上下文越長,模型需要處理的資訊量也越大。
這組數據比較了同一台筆電在不同上下文長度下的效能變化。不過,模型量化精度、記憶體配置、Strix Halo 的詳細規格與功耗設定均未公開,因此難以直接與其他電腦的測試結果比較。
硬體與執行設定不同,即使使用相同模型,輸入與輸出速度也可能出現差異。
布特林表示,llama.cpp 對該模型的處理效率正在快速改善。他評價,本機模型「正逐漸接近能夠直接處理大多數工作的階段」。
維塔利克·布特林(Vitalik Buterin)以太坊共同創辦人也提出,可將本機模型用作保護隱私的協調層。他表示,讓「本機模型協調向更強大模型提出的查詢,避免包含個人隱私的問題外洩」的工作流程,已開始變得可行。這意味著本機模型可先處理使用者問題,再判斷哪些內容交由雲端模型處理、哪些內容留在裝置上。
其核心在於,包含敏感資訊的請求不必原封不動地傳送至外部伺服器。布特林先前曾表示,若要推動隱私技術普及,導入成本與使用便利性相當重要。
不過,這次結果僅來自特定筆電與執行環境。若要評估本機 AI 模型的實際應用可行性,仍需進一步公開模型設定、記憶體配置與功耗條件的測試。
留言 0