Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Gemini 3.8 Live與TTS是不同模型 Google公開兩款即時語音AI

使用智慧型手機與語音AI對話的手/TokenPost.ai

Google($GOOGL)公開兩款支援即時語音對話與延伸推理的Gemini 3.8 Live模型,但Google官方資料尚未確認存在名為Gemini 3.8 TTS的獨立文字轉語音模型。

Google於15日透過開發者使用的Gemini API與Google AI Studio,推出Gemini 3.8 Live以及Gemini 3.8 Live Extended Thinking。

Gemini 3.8 Live能在進行即時語音對話的同時處理視覺資訊。開發者也能讓模型在對話期間於背景呼叫API與外部工具。

Gemini 3.8 Live Extended Thinking則聚焦複雜推理與多階段任務。使用者持續以語音對話時,模型可同步處理其他工作。

兩款模型支援超過97種語言與一致的語調,也能即時處理語音輸入、影片和圖片。

Google表示,延伸推理模型在Artificial Analysis的Speech to Speech Quality Index中以82.6分排名第一。不過,這項數據是根據Google公開的比較資料,是否經過獨立重新驗證尚未確認。

此次公開顯示,Google在官方發表中結合了即時對話、視覺輸入、推理與工具呼叫功能。不過,Gemini 3.8 Live系列的核心在於建構對話式AI,而非單純將文字轉換成語音。

TTS是將文字轉換為語音的技術。Gemini 3.8 Live則是在理解語音輸入後以語音回應,兩者的處理流程與應用目的不同。

Google正式公開的獨立TTS模型是Gemini 3.1 Flash TTS。該模型可透過自然語言指令與表達式音訊標籤,調整說話方式、速度與情緒等效果。

Gemini 3.1 Flash TTS支援超過70種語言及多名說話者對話,主要用於將文字內容自然地輸出為語音。

Google Cloud文件介紹的Gemini-TTS支援包括韓語在內的多種語言,也提供適合詩歌、新聞與說故事的表達式朗讀,以及情緒、語調和語速控制功能。

不過,Gemini-TTS文件是否代表Gemini 3.8 TTS已推出,尚未確認。從官方產品名稱來看,Gemini 3.8 Live系列與Gemini 3.1 Flash TTS屬於不同產品線。

在先前已有Google公開兩款支援即時語音對話與延伸推理的Gemini 3.8 Live模型消息傳出後,此次確認有助於區分相關模型與TTS技術的用途。

Google的Gemini 3.5 Transcribe已在官方文件中確認支援韓語。不過,僅憑此次發表,仍難以判斷Gemini 3.8 Live的韓語對話品質與實際使用範圍。

兩款Gemini 3.8 Live模型目前提供開發者透過Gemini API與Google AI Studio使用。Gemini 3.8 TTS的確切產品名稱及是否獨立推出,仍有待Google進一步發布官方消息。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1