字節跳動(ByteDance)已將能一邊聆聽用戶說話、一邊即時回應的語音AI模型「Seeduplex」全面部署至旗下應用程式豆包(Doubao)。豆包是中國大型生成式AI應用,2026年春節期間日活躍用戶數已突破1億人。
字節跳動的AI研發團隊Seed於4月9日透過官方部落格公布「Seeduplex」。與必須等用戶說完話才回應的傳統語音助理不同,「Seeduplex」屬於全雙工語音大型語言模型,能同時處理語音與語意資訊,藉此判斷對話節奏。
字節跳動表示,在複雜噪音環境下,「Seeduplex」的錯誤回應率與錯誤打斷率較既有半雙工模型降低一半。用戶猶豫或思考時AI搶先插話的比例減少40%,對話流暢度指標與斷句判斷指標則分別提升12%與8%。
「Seeduplex」發表當時即已全面套用於豆包應用程式。此後,字節跳動為豆包新增能同時處理語音與畫面的即時多模態功能,可偵測畫面變化或操作錯誤,在用戶提問前主動提醒,將原本以語音為主的即時互動延伸至視覺領域。
豆包龐大的用戶規模,成為模型效能得以落實為實際消費端服務的基礎。路透社報導,根據AICPB.com統計,豆包已於2月16日日活躍用戶數突破1億人。字節跳動也表示,在中國中央電視台(CCTV)春節聯歡晚會播出期間,豆包處理了逾19億筆AI相關詢問。
《WIRED》報導指出,截至2025年8月,豆包月活躍用戶數達1億5700萬人,登上中國生成式AI應用榜首。這顯示即時AI的競爭已不僅止於模型效能發表,更延伸至大型消費端應用的使用體驗與部署規模之爭。
競爭對手OpenAI的「GPT-Realtime」依官方API文件,支援即時文字與語音輸入輸出,但不支援影像。字母控股(Alphabet,$GOOGL)旗下Google則在「Gemini Live」中提供結合鏡頭與畫面分享的即時對話功能。相較之下,「Seeduplex」主打的是聽與說同步處理,以及噪音抑制與對話插話判斷能力。
此次部署與加密貨幣市場的直接關聯目前未獲確認。字節跳動Seed團隊的官方公告中,並未提及發行代幣、串接區塊鏈網路或運用去中心化AI基礎設施的計畫。目前公開的內容,屬於中心化平台將自研AI模型套用於大型消費端應用的案例。
留言 0