谷歌(Google,$GOOGL)推出Gemini 3.8 Flash TTS,可逐句調整語氣、情緒與方言,將語音生成從單純朗讀延伸至角色製作與多名說話者內容。
谷歌於23日公開Gemini 3.8 Flash TTS與Gemini 3.8 Flash-Lite TTS。Flash TTS著重語音品質與表現力,Flash-Lite TTS則聚焦大量生成與低延遲語音代理。
Gemini 3.8 Flash TTS可透過自然語言提示建立新聲音,並逐句指定說話方式、速度、情緒與語調。在多名說話者參與的對話中,模型也能維持各說話者的音色,提高長時間語音內容的一致性。
Flash-Lite TTS則鎖定重視處理量與回應速度的工作,主要應用包括大量內容製作、即時語音代理與朗讀功能。
兩款模型均支援利用30秒音訊樣本進行語音複製。谷歌表示,語音複製流程會要求確認同意,生成語音則會套用可識別人工智慧生成內容的SynthID浮水印。
谷歌開發者文件顯示,Flash TTS支援130種語言,Flash-Lite TTS支援101種語言。谷歌列出的應用場景包括有聲書、錄音室旁白、遊戲角色、Podcast、多名說話者對話,以及高難度發音與地方方言處理。
發音基準數據需另外區分。Crypto Briefing報導,Gemini 3.8 Flash TTS在Artificial Analysis的「Pronunciation Robustness Benchmark」中取得89.5%,排名第一。
Artificial Analysis公開的方法,是讓模型朗讀發音困難的句子,再由獨立評估者判斷每句的發音準確度。評估內容包括會因語境改變發音的單字,以及數字、日期、單位、程式碼與專有名詞。
不過,Artificial Analysis公開頁面目前無法確認Gemini 3.8 Flash TTS的89.5%分數與排名。在原始資料公開或結果可重現前,該數據應標示為Crypto Briefing所報導的內容。
谷歌表示,Gemini 3.8 Flash TTS在Hume AI的Voice Design Benchmark中取得總分71.4分,語調建模項目則為60.8分,均位居前列。Hume AI將語音人工智慧分為自然度、指令遵循、角色適配性與語調等多個項目進行評估。
Hume AI公開資料中可確認的Gemini 3.1 Flash指標,來自評估情緒、表達方式與角色適配性的另一項結果。因此,該數據難以與Artificial Analysis的發音穩健度分數直接比較。
此次模型與谷歌先前公開、支援即時語音對話與擴展推理的兩款Gemini 3.8 Live模型用途不同。Live系列著重理解語音輸入並進行對話式回應,TTS則是將文字轉換為語音的技術。
本刊此前報導Gemini 3.8 Live與TTS為不同模型,也指出兩項技術的處理流程與應用目的有所差異。此次發布顯示,語音人工智慧產品線正將即時對話與語音製作功能分別擴展至不同模型。
谷歌將遊戲、有聲書、Podcast與互動媒體列為主要應用場景,並公布與Figma、HeyGen、Linguana及Wondercraft的合作。不過,各合作夥伴的實際導入範圍與商業成果尚未公布。
實際服務競爭力難以只靠單一發音分數判斷。多語言與方言處理品質、回應延遲、生成成本、長時間語音穩定性,以及語音複製的同意與可追溯性,仍需一併觀察。
留言 0