Google DeepMind公開支援即時語音對話、視覺資訊理解與複雜推理的「Gemini 3.8 Live」及「Gemini 3.8 Live Extended Thinking」。
Gemini 3.8 Live是聚焦成本效益與大規模處理的語音介面模型,支援近乎即時的對話與推理,也能理解對話期間的視覺資訊。
Google DeepMind在官方Gemini Audio頁面說明,新模型能將視覺輸入納入對話脈絡後回應。這代表以語音為主的人工智慧介面,進一步延伸至同時理解螢幕與攝影機畫面。
Gemini 3.8 Live Extended Thinking則鎖定複雜推理與多階段任務執行。官方介紹的應用情境包括將背景工作分配給多個代理程式,同時維持自然的語音對話。
開發者可透過Google AI Studio與Gemini Live API測試兩款模型,並實作語音與影像互動功能。語音輸出則採用Google的合成內容識別技術SynthID。
Google DeepMind表示,SynthID能辨識由Google人工智慧生成或編輯的語音。不過,公開資料尚未包含獨立基準測試數據、外部評估結果、回應延遲時間與使用成本。
Google正將語音人工智慧從對話工具延伸至可執行工作的工具。Google在8月26日公開的Gemini Live更新中,展示以語音指令摘要Gmail與Calendar資訊,以及搜尋、分類和封存電子郵件的功能,並表示當時有63%的Gemini使用者透過語音使用服務。
對台灣使用者而言,語音辨識與多語言處理範圍是主要關注焦點。本報先前曾報導,Google的語音轉文字人工智慧模型已在官方文件中確認支援韓語,因此新模型的韓語對話品質與實際可用範圍仍有待後續確認。
Gemini 3.8 Live的公開將如何改變Google的人工智慧競爭力,仍取決於實際使用性、回應延遲時間、成本與安全性評估。Google DeepMind預計將這款模型與開發者工具一同提供。
目前尚未提出與虛擬資產及區塊鏈領域直接相關的應用案例或市場影響。可以確認的是,語音人工智慧已延伸至視覺理解與代理程式工作處理,相關產業連結仍須透過後續發布與外部評估確認。
留言 0