深度求索(DeepSeek)旗下新版模型V4.1 Flash在內部測試中,交出每秒420個Token的「輸出速度」,連續產生超過7萬1000個Token僅花不到3分鐘。
根據BlockBeats(律動BlockBeats)報導,該媒體於8日公布首份實測結果,並提到作為對照組的深度求索(DeepSeek) V4 Flash 0731,其官方API輸出速度依人工智慧測試機構Artificial Analysis的測量約為每秒128個Token。
不過,兩項數字是否在相同條件下測得並未公開,單純比較仍有侷限。這次每秒420個Token的紀錄同樣只是內部測試的單一實測結果,實際速度可能因輸入長度、請求方式與伺服器條件而有所不同。
「Token」是人工智慧模型處理句子的基本單位,「輸出速度」則代表模型生成答案的快慢;數值愈高,代表在產生長篇程式碼或文件時,回應時間可能愈短。
V4.1 Flash是主打全新模型架構與「多模態」功能的測試版本,多模態指的是能同時處理文字與圖片的技術。
這款測試版沿用既有API位址,只需將模型名稱改為deepseek-v4.1-flash-expires-on-0910即可呼叫,每個帳號的同時請求數上限為20個。深度求索(DeepSeek)先前公布的內部測試條件,同樣是維持既有API位址並將同時請求數限制在20個。
模型名稱中的「0910」究竟代表測試結束日期,還是與正式模型轉換時間點有關,目前尚未獲得證實;正式上線與否、提供期間及最終價格也都尚未公布。
這款測試版的收費與既有的深度求索(DeepSeek) V4 Flash相同。深度求索(DeepSeek)官方文件說明,V4 Flash的價格是依輸入與輸出的Token數量計算,因此僅憑這次的速度紀錄,還難以判定API使用成本已經降低。
深度求索(DeepSeek) V4 Flash已於7月31日轉為公開測試版。官方文件當時說明,V4 Flash 0731在維持既有預覽模型相同架構與規模的同時,經過了重新訓練。
由於V4.1 Flash標榜採用全新架構,與既有版本的性能差異須待相同條件下的官方基準測試公開後才能比較,單憑輸出速度也難以判斷模型的推理能力或結果品質。
若要判斷是否能實際導入服務,還須一併確認同時請求數量、回應延遲時間、長文本處理能力、輸出品質與成本等條件。目前公開的核心數據,僅有內部測試測得的輸出速度與有限的呼叫條件。
正式版本公布後,能否在相同輸入、伺服器與請求條件下與V4 Flash 0731進行比較,將是後續觀察重點;評價結果也將隨深度求索(DeepSeek)正式發布公告與各項基準測試的公開時間而有所不同。
留言 0