輝達($NVDA)公開可即時區分最多8名說話者、具1億參數規模的語音分離模型 Nemotron 3 Diarization。該模型採公開權重,可應用於會議紀錄、客服中心分析及語音AI代理等場景。
輝達23日透過 Hugging Face 貼文公開模型。Nemotron 3 Diarization 可在 Hugging Face 與 NeMo 上使用,並以單一模型支援錄音檔處理與即時串流。
語音分離不同於將語音轉換為文字的語音辨識,主要用於判斷「誰在何時說話」。模型不會確認說話者真實姓名,而是依發言順序標記為 speaker_1、speaker_2 等匿名標籤。
因此,若沒有會議參與者資料或額外的說話者驗證模型,便無法將標籤與實際人物連結。若要在同時管理語音內容與說話者的會議紀錄、諮詢紀錄及訪談編輯中使用,仍需要額外的身分辨識機制。
模型每10毫秒輸出一次說話者活動機率,也能處理多人同時發言的重疊語音。輸入緩衝延遲時間可調整為0.32秒、0.64秒、1.04秒及30.4秒等設定。
0.32秒是輝達建議設定中延遲時間最短的選項。技術上也能使用80毫秒輸入緩衝,但準確度與處理量可能下降。
串流過程會使用「Arrival-Order Speaker Cache」功能,按照說話者首次出現的順序分配標籤,並在後續語音區段維持相同標籤,降低區段切換時說話者編號改變的問題。
輝達表示,在 VoiceArena 初期 Diarization-Bench 評測中,Nemotron 3 Diarization 在12個系統中排名第一。該評測以139段英語對話、約22小時語音為對象,納入重疊語音後,模型的說話者分離錯誤率(DER)為14.72%。
排名第二的系統 DER 為19.3%。不過,輝達說明,相關結果仍屬初步評測,正式評估與統計分析完成後,結果可能改變。
Nemotron 3 Diarization 將支援說話者數量從既有的4人串流 Sortformer v2.1 增加至8人。輝達表示,模型使用公開及授權語音資料訓練,也納入 David AI 的多說話者語音資料。
輝達說明,在特定評測條件下加入相關資料後,DER 從11.19%改善至10.42%,下降0.77個百分點。這項數據來自不同評測條件,不能與 VoiceArena 的14.72%直接比較。
公開權重也是該模型的特色。Hugging Face 模型頁面與 Baseten 將授權標示為 OpenMDW-1.1,Baseten則提供串流與批次推論的部署環境。
不過,部署業者的處理量與模型本身的效能需要分開評估。說話者分離錯誤率會受到資料集、延遲時間、是否納入重疊語音及邊界容許時間等因素影響,因此難以與 AISHELL-4 等其他評測結果直接比較。
模型在當地語音資料與韓語環境下的表現,也需要另行驗證。若要將語音模型應用於會議紀錄或客服中心,除了支援語言,也應一併確認處理延遲、成本及說話者標籤的穩定性。
此次公開與加密貨幣或區塊鏈技術沒有直接關聯。不過,輝達持續擴大公開模型生態系,並將公開範圍延伸至語音處理模型,這一動向仍值得留意。
輝達已將以大型語言模型為核心的公開模型策略延伸至語音處理領域。未來實際服務中的韓語、多說話者環境表現,以及授權適用範圍,將成為觀察重點。
留言 0