Google推出支援即時語音對話與視覺資訊處理的Gemini 3.8 Live模型,但影片化身功能Live Avatar是否正式發布,仍未在Google官方資料中獲得獨立確認。
Google於15日推出Gemini 3.8 Live與Gemini 3.8 Live Extended Thinking。兩款模型可在持續語音對話的同時處理視覺資訊,並在對話期間於背景呼叫工具與API。
企業服務方面,Gemini Enterprise已開始提供私密預覽,之後也預計向Gemini Enterprise客戶體驗服務提供。
此次發布是Google公開兩款支援即時語音對話與擴展推理的Gemini 3.8 Live模型後續確認的一部分。爭議焦點在於,影片化身功能是否與模型發布一同推出。
Crypto Briefing於24日報導,Google公開了企業用即時影片化身功能Live Avatar。報導稱,該功能支援配合語音變化的化身嘴型與表情、企業資料治理,以及SynthID浮水印。
然而,Google官方公告與開發者文件均未出現Live Avatar這項獨立功能或產品。客製化化身的允許清單、套用於所有生成影片的SynthID,以及面向企業客戶的影片化身推出時程,也未能以相同方式確認。
語言支援數字也因資料來源不同而存在差異。Google的Gemini 3.8 Live發布公告指出,模型可在對話中自動偵測並切換97種語言;Gemini Live API文件則列出支援99種語言。
這兩項數字可能適用於不同對象。目前沒有證據顯示Live API支援的99種語言可直接套用於影片化身功能。
根據官方資料,目前確認適用SynthID的對象是AI生成音訊。Google表示,系統會在語音輸出中加入人類難以察覺的浮水印,以協助辨識AI生成內容。
因此,「所有生成影片均套用SynthID」的說法,應與音訊浮水印有所區分。影片化身是否採用相同技術,仍需Google另行發布公告。
Google並非沒有提供企業用AI化身。Google Vids已內建根據腳本製作簡報影片的客製化AI化身功能,也能製作融入企業標誌與背景的影片。
Google Vids生成的影片會套用SynthID浮水印。不過,Google Vids是影片製作工具,提供方式與Gemini 3.8 Live這類支援即時語音對話的化身服務不同。
開發者可透過Gemini API與Google AI Studio使用Gemini 3.8 Live。Google將語音導向的即時互動與視覺脈絡理解列為主要功能。
企業客戶的實際使用案例、價格、提供地區,以及影片化身的API存取方式目前尚未公開。介紹相關功能的貼文雖已在Reddit社群分享,但僅憑社群貼文,仍無法確認正式發布或技術規格。
目前由Google官方資料確認的範圍,包括Gemini 3.8 Live與Extended Thinking模型發布,以及企業用語音AI私密預覽。Live Avatar是否正式推出、影片功能的詳細規格為何,仍須等待Google進一步說明。
留言 0