字節跳動(ByteDance)已將能同時處理語音、影像與文字的全雙工AI模型SeedRealtime導入旗下豆包(Doubao)應用程式。
字節跳動旗下AI研究團隊Seed於10日公開了SeedRealtime。TechFlow報導指出,該模型以端到端架構整合音訊、影像與文字,並將辨識、理解、判斷與表達等流程並行處理。
SeedRealtime支援全雙工互動,能在接收使用者輸入的同時判斷對話走向,不必等使用者說完話才回應。模型內部直接內建對話輪替判斷功能,取代了外部語音活動偵測器(VAD)。根據字節跳動內部評測,對話節奏出現問題的比例較過去的串接式架構降低了一半。
此次發表的模型,是將去年4月公開的全雙工語音模型Seeduplex的功能延伸至影像領域而成。字節跳動表示,Seeduplex在複雜噪音環境下,將誤回應率與誤打斷率都降低了一半;使用者猶豫停頓時AI搶話插入的比例減少40%,對話流暢度指標則提升12%。
本媒體先前曾報導,豆包導入了能同時處理語音與畫面、並優先提示作業錯誤的即時多模態功能。SeedRealtime則是將原本僅止於文字生成的對話式AI,進一步拓展至即時語音通話、畫面理解與影像辨識的模型。
不過,此次發表內容目前尚未證實與加密貨幣、區塊鏈市場有直接關聯。字節跳動公開的資訊中,並未包含代幣發行或區塊鏈網路串接的相關計劃,技術報告、參數規模、開源權重以及供外部開發者使用的API也都尚未公開。
留言 0