Grok Voice已接入面向開發者的AI語音基礎設施平台fal.ai,費用為每秒音訊0.00083美元(約1.13韓元)。
開發者無需分別整合語音辨識、語言處理與語音合成API,即可運用語音對語音模型建立即時語音代理。fal.ai在服務頁面表示,平台提供處理錄音檔的HTTP API,以及支援即時雙向對話的WebSocket API。
WebSocket API採用全雙工通訊架構,使用者說話期間,代理即可作出回應。首段語音回應目標為1秒內完成,但實際延遲時間仍會受到輸入環境與網路條件影響。
過去的語音代理通常依序串接語音辨識(STT)、大型語言模型處理與語音合成(TTS)。Grok Voice則將這些流程整合至語音對語音模型,主打降低分別管理多項服務與基礎設施的負擔。
fal.ai公布的費用約為每分鐘0.05美元(約68韓元)。連續1小時語音互動的費用約為3美元(約4080韓元),按用量計費,且沒有最低用量要求。
語言支援範圍超過25種,並提供25種基本語音與自訂語音,也支援語音複製功能。
xAI在公告中表示,7月6日在原有5種語音之外,新增21種多語言語音,並說明使用約1分鐘的語音即可建立自訂語音。
系統也具備代理在對話期間呼叫外部函式的功能,可在對話流程中執行查詢客戶帳戶、確認庫存與處理交易等連接外部系統的工作。
實際導入服務時,仍須分別管理語音複製對象的同意、個人資料保護及外部系統存取權限。尤其外部函式呼叫會把語音對話連接至實際業務處理,因此有必要區分權限範圍。
此次接入更接近面向開發者與企業的API擴充,而非消費者版Grok應用程式更新。xAI透過Grok Voice Agent API公開資料,於2025年12月發布開發者語音API。
xAI在2026年4月發布Grok Voice Think Fast 1.0,並於7月公開Think Fast 2.0,各次發布均主打語音推理、對話及工具使用功能改善。
fal.ai提供透過單一SDK與無伺服器API連接多種生成式AI模型的開發環境。此次接入後,Grok Voice也被納入可與影像、影片生成模型一同使用的開發者模型選項。
語音對語音方式不會將語音輸入拆分為文字處理與語音合成階段,而是直接連接至語音輸出。WebSocket則是讓伺服器與客戶端維持連線,並即時交換資料的通訊方式。
目前尚未確認此次接入在社群平台的量化傳播規模,或主要業界人士的額外反應。除官方頁面列出的價格與功能外,對實際用量及服務品質的影響仍有待進一步驗證。
留言 0