Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

豆包升級即時多模態 能看懂畫面主動提醒

字節跳動相關圖片 / TokenPost.ai

字節跳動(ByteDance)旗下AI助理豆包(Doubao)導入能同時處理語音與畫面的即時多模態功能。核心在於主動式互動:系統能在使用者提問前,先偵測畫面變化或操作錯誤並主動提醒。

字節跳動AI研究團隊Seed於5日發表SeedRealtime,並已套用至豆包App。BlockBeats報導指出,這項新功能能同時處理聲音與畫面,理解使用者眼前的場景並做出回應。

透過SeedRealtime,使用者可以在鏡頭前尋找物品、檢查作業流程,或讀取畫面中的文字。當目標物出現、畫面發生變化,或使用者操作步驟有誤時,系統不需等待提問即可主動提示。

此次更新是將去年4月發表的前代語音模型Seeduplex功能延伸至視覺領域。字節跳動Seed團隊在4月9日的官方部落格中,將Seeduplex定位為能同時處理聆聽與說話的全雙工語音大型模型。

Seeduplex發表當時已全面套用至豆包App。字節跳動Seed團隊表示,在複雜聲音環境下,錯誤應答率與誤判中斷率降低一半,AI在複雜情境中打斷使用者發言的比例也下降40%。

全雙工是一種能同時處理聆聽與說話的互動方式,不同於需等待對方說完話的半雙工模式。SeedRealtime在此基礎上結合即時畫面理解,設計目的是讓系統能直接解讀桌面物品、操作畫面、標示牌與組裝過程等情境脈絡。

能理解畫面的AI助理並非中國平台獨有的發展趨勢。蘋果(AAPL)同樣在Siri改版過程中提出畫面辨識與個人情境理解功能。AI助理的競爭領域正從語音應答,擴大至即時視覺理解與操作協助。

隨著即時視覺輸入功能加入,個資處理方式也成為重要考量。豆包的隱私權政策說明,僅在使用者主動開啟視訊通話或畫面分享後,系統才會處理鏡頭拍攝或分享畫面的內容,麥克風、相簿、鏡頭等敏感權限則須經使用者明確同意後才會啟用。

目前尚未發現這項功能與加密貨幣、區塊鏈市場有直接關聯。字節跳動公開的內容,重點仍聚焦於AI助理的語音與畫面互動功能。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1