Google($GOOGL)公開兩款支援即時語音對話與延伸推理的Gemini 3.8 Live模型,但Google官方資料尚未確認存在名為Gemini 3.8 TTS的獨立文字轉語音模型。
Google於15日透過開發者使用的Gemini API與Google AI Studio,推出Gemini 3.8 Live以及Gemini 3.8 Live Extended Thinking。
Gemini 3.8 Live能在進行即時語音對話的同時處理視覺資訊。開發者也能讓模型在對話期間於背景呼叫API與外部工具。
Gemini 3.8 Live Extended Thinking則聚焦複雜推理與多階段任務。使用者持續以語音對話時,模型可同步處理其他工作。
兩款模型支援超過97種語言與一致的語調,也能即時處理語音輸入、影片和圖片。
Google表示,延伸推理模型在Artificial Analysis的Speech to Speech Quality Index中以82.6分排名第一。不過,這項數據是根據Google公開的比較資料,是否經過獨立重新驗證尚未確認。
此次公開顯示,Google在官方發表中結合了即時對話、視覺輸入、推理與工具呼叫功能。不過,Gemini 3.8 Live系列的核心在於建構對話式AI,而非單純將文字轉換成語音。
TTS是將文字轉換為語音的技術。Gemini 3.8 Live則是在理解語音輸入後以語音回應,兩者的處理流程與應用目的不同。
Google正式公開的獨立TTS模型是Gemini 3.1 Flash TTS。該模型可透過自然語言指令與表達式音訊標籤,調整說話方式、速度與情緒等效果。
Gemini 3.1 Flash TTS支援超過70種語言及多名說話者對話,主要用於將文字內容自然地輸出為語音。
Google Cloud文件介紹的Gemini-TTS支援包括韓語在內的多種語言,也提供適合詩歌、新聞與說故事的表達式朗讀,以及情緒、語調和語速控制功能。
不過,Gemini-TTS文件是否代表Gemini 3.8 TTS已推出,尚未確認。從官方產品名稱來看,Gemini 3.8 Live系列與Gemini 3.1 Flash TTS屬於不同產品線。
在先前已有Google公開兩款支援即時語音對話與延伸推理的Gemini 3.8 Live模型消息傳出後,此次確認有助於區分相關模型與TTS技術的用途。
Google的Gemini 3.5 Transcribe已在官方文件中確認支援韓語。不過,僅憑此次發表,仍難以判斷Gemini 3.8 Live的韓語對話品質與實際使用範圍。
兩款Gemini 3.8 Live模型目前提供開發者透過Gemini API與Google AI Studio使用。Gemini 3.8 TTS的確切產品名稱及是否獨立推出,仍有待Google進一步發布官方消息。
留言 0