Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

75.7%評測者偏好GPT-Live-1 勝過舊版語音模式

OpenAI相關圖片 / TokenPost.ai

OpenAI已將能一邊聆聽用戶說話、一邊即時生成回應的全雙工語音模型GPT-Live正式上線。根據人類評測結果,75.7%的參與者表示更偏好GPT-Live-1,勝過先前的Advanced Voice Mode。

OpenAI於7月8日宣布,將GPT-Live-1與GPT-Live-1 mini陸續開放給全球ChatGPT Voice用戶。GPT-Live-1是Go、Plus、Pro付費方案用戶的預設語音模型,GPT-Live-1 mini則作為免費用戶的預設語音模型提供。

GPT-Live把語音AI的回應單位,從單向的「輪流對話」改成連續不間斷的「對話流」。舊有語音AI通常要等用戶說完話才開始生成回應,GPT-Live則是在持續處理輸入語音的同時,同步生成輸出語音。模型在這個過程中,每秒都要多次判斷該開口說話、繼續聆聽、暫停、插話,還是呼叫工具。

高難度任務則交由另一條路徑處理。GPT-Live在維持即時對話的同時,會把網路搜尋、深度推理與代理型任務交給背景運作的前沿模型負責,公開當下採用的背景模型是GPT-5.5。OpenAI說明,這樣的設計是為了讓對話不會因為搜尋或推理結果尚未就緒而中斷。

在5到10分鐘、條件相同的對話評測中,參與者相較舊版Advanced Voice Mode,有75.7%更偏好GPT-Live-1,69.2%更偏好GPT-Live-1 mini。評測項目包含整體偏好度、輪流對話、插話應對、對話流暢度與自然程度。

目前支援範圍仍有限制。OpenAI說明中心(OpenAI Help Center)指出,GPT-Live目前提供於iOS、Android與ChatGPT.com,並支援網路搜尋、記憶功能、視覺卡片,以及文字與圖片輸入。不過上線初期尚未支援影片、螢幕分享、已連接的應用程式與外掛,有這類需求的用戶仍須改用舊版Advanced Voice Mode。

OpenAI在GPT-Live系統卡(GPT-Live System Card)中表示,已針對自傷、精神病與躁症、對AI產生情感依賴、暴力、色情內容,以及冒充與語音複製等風險進行評估。一旦偵測到風險訊號,系統會調整回應內容或提出安全提示,遇到高風險情況時甚至可能直接終止語音對話。這也呼應本刊此前報導的前沿AI模型風險預先審查討論

阿蒂·埃萊蒂(Atty Eleti)OpenAI ChatGPT Voice產品負責人在接受Axios採訪時表示:「隨著時間推移,我認為這能開啟把語音當作運算主要介面來使用的可能性。」這番話顯示,他期待語音AI能改變目前以文字為主的使用方式。Axios也指出,語音功能的使用通常比文字消耗更多成本與token。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1