Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

豆包導入全雙工AI SeedRealtime 語音影像同步處理

手機螢幕上顯示的即時語音視訊通話畫面 / TokenPost.ai

字節跳動(ByteDance)已將能同時處理語音、影像與文字的全雙工AI模型SeedRealtime導入旗下豆包(Doubao)應用程式。

字節跳動旗下AI研究團隊Seed於10日公開了SeedRealtime。TechFlow報導指出,該模型以端到端架構整合音訊、影像與文字,並將辨識、理解、判斷與表達等流程並行處理。

SeedRealtime支援全雙工互動,能在接收使用者輸入的同時判斷對話走向,不必等使用者說完話才回應。模型內部直接內建對話輪替判斷功能,取代了外部語音活動偵測器(VAD)。根據字節跳動內部評測,對話節奏出現問題的比例較過去的串接式架構降低了一半。

此次發表的模型,是將去年4月公開的全雙工語音模型Seeduplex的功能延伸至影像領域而成。字節跳動表示,Seeduplex在複雜噪音環境下,將誤回應率與誤打斷率都降低了一半;使用者猶豫停頓時AI搶話插入的比例減少40%,對話流暢度指標則提升12%。

本媒體先前曾報導,豆包導入了能同時處理語音與畫面、並優先提示作業錯誤的即時多模態功能。SeedRealtime則是將原本僅止於文字生成的對話式AI,進一步拓展至即時語音通話、畫面理解與影像辨識的模型。

不過,此次發表內容目前尚未證實與加密貨幣、區塊鏈市場有直接關聯。字節跳動公開的資訊中,並未包含代幣發行或區塊鏈網路串接的相關計劃,技術報告、參數規模、開源權重以及供外部開發者使用的API也都尚未公開。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1