谷歌(GOOGL)在語音辨識模型「Gemini 3.5 Transcribe」的官方文件中,正式列出韓文支援。這款模型能自動辨識超過85種語言,但中文類別目前只收錄中國大陸的簡體普通話與香港的繁體粵語,台灣慣用的繁體中文或台灣華語並未另外設立獨立項目。
谷歌26日在官方部落格上,將「Gemini 3.5 Transcribe」列為Gemini音訊系列產品中最新的語音轉文字模型。即時轉錄採用「gemini-3.5-transcribe-live」模型,錄音檔案處理則使用「gemini-3.5-transcribe」模型。
這款模型的重點不只是單純聽寫,而是把自然對話整理成文件等級的文字。谷歌說明,模型能處理說話過程中的自我修正、停頓、贅詞與專業術語,轉換成附有標點符號與格式的完整文字。
應用場景包括會議錄音、客服中心通話、即時字幕與語音助理。用於即時轉錄的模型透過即時API(Live API)提供雙向串流,目標是把延遲控制在1秒以內。
本站先前已報導谷歌推出支援85種以上語言轉錄模型的消息(相關報導)。這次官方文件的確認,讓韓文支援與否、中文圈細項分類、處理上限、語者區分限制等細節更加明確。
谷歌開發者文件的支援語言清單中,韓文以「ko-KR」列出。中文圈項目則標示為中國大陸簡體普通話「cmn-Hans-CN」與香港繁體粵語「yue-Hant-HK」。
轉錄模型的語言清單,與一般翻譯支援範圍不同。實際語音辨識牽涉發音、腔調、地區用語與文字系統,即使同屬中文圈,是否單獨列項也可能左右服務品質與導入評估,這點對台灣使用者來說格外值得留意。
效能數據同步公開。谷歌引用Artificial Analysis的測試結果指出,串流環境下平均字詞錯誤率(WER)為4.0%,非串流環境則為2.6%。
在FLEURS基準測試中,以主要語言與地區為準的WER,串流為5.50%,非串流為5.04%。WER是衡量轉錄結果與人工標準文字差異程度的指標,數值越低代表準確度越高。
模型也附帶開發者可自行調校的功能。谷歌開發者文件說明,自訂詞彙最多可輸入1,000筆,但通常在100筆以內時效果最佳。
自訂詞彙功能鎖定公司名稱、產品名稱、縮寫、人名等一般語音辨識容易出錯的詞彙。在客服對話或會議紀錄等專有名詞頻繁出現的工作場景中,這項功能可能成為左右轉錄品質的關鍵。
文件也載明處理上限。一般錄音檔案單次最多可處理1小時,若開啟語者區分或逐字時間戳記功能,上限則縮短為30分鐘。
語者區分最多支援8人,不過3人以上的語者辨識仍屬實驗性功能,實際會議或訪談場景的穩定性有待驗證。
谷歌DeepMind的模型卡說明,Gemini 3.5 Audio以Gemini 3 Pro為基礎,轉錄與即時轉錄的輸入為音訊與文字,輸出則為文字。
模型卡也提到,轉錄模型仍可能出現基礎模型常見的限制,包括幻覺、延遲或逾時等問題。企業若要將這類技術導入會議紀錄、客服記錄或即時字幕服務,除了支援語言與準確度外,處理時間、成本結構與語者區分的穩定性也都是評估重點。
留言 0