OpenAI已將能一邊聆聽用戶說話、一邊即時生成回應的全雙工語音模型GPT-Live正式上線。根據人類評測結果,75.7%的參與者表示更偏好GPT-Live-1,勝過先前的Advanced Voice Mode。
OpenAI於7月8日宣布,將GPT-Live-1與GPT-Live-1 mini陸續開放給全球ChatGPT Voice用戶。GPT-Live-1是Go、Plus、Pro付費方案用戶的預設語音模型,GPT-Live-1 mini則作為免費用戶的預設語音模型提供。
GPT-Live把語音AI的回應單位,從單向的「輪流對話」改成連續不間斷的「對話流」。舊有語音AI通常要等用戶說完話才開始生成回應,GPT-Live則是在持續處理輸入語音的同時,同步生成輸出語音。模型在這個過程中,每秒都要多次判斷該開口說話、繼續聆聽、暫停、插話,還是呼叫工具。
高難度任務則交由另一條路徑處理。GPT-Live在維持即時對話的同時,會把網路搜尋、深度推理與代理型任務交給背景運作的前沿模型負責,公開當下採用的背景模型是GPT-5.5。OpenAI說明,這樣的設計是為了讓對話不會因為搜尋或推理結果尚未就緒而中斷。
在5到10分鐘、條件相同的對話評測中,參與者相較舊版Advanced Voice Mode,有75.7%更偏好GPT-Live-1,69.2%更偏好GPT-Live-1 mini。評測項目包含整體偏好度、輪流對話、插話應對、對話流暢度與自然程度。
目前支援範圍仍有限制。OpenAI說明中心(OpenAI Help Center)指出,GPT-Live目前提供於iOS、Android與ChatGPT.com,並支援網路搜尋、記憶功能、視覺卡片,以及文字與圖片輸入。不過上線初期尚未支援影片、螢幕分享、已連接的應用程式與外掛,有這類需求的用戶仍須改用舊版Advanced Voice Mode。
OpenAI在GPT-Live系統卡(GPT-Live System Card)中表示,已針對自傷、精神病與躁症、對AI產生情感依賴、暴力、色情內容,以及冒充與語音複製等風險進行評估。一旦偵測到風險訊號,系統會調整回應內容或提出安全提示,遇到高風險情況時甚至可能直接終止語音對話。這也呼應本刊此前報導的前沿AI模型風險預先審查討論。
阿蒂·埃萊蒂(Atty Eleti)OpenAI ChatGPT Voice產品負責人在接受Axios採訪時表示:「隨著時間推移,我認為這能開啟把語音當作運算主要介面來使用的可能性。」這番話顯示,他期待語音AI能改變目前以文字為主的使用方式。Axios也指出,語音功能的使用通常比文字消耗更多成本與token。
留言 0