騰訊(00700.HK)推出旗下混元(Hunyuan)系列語音辨識模型「Hy ASR 3.0 Preview」,並同步開放雲端API服務。這項新模型的登場,象徵騰訊正加速把語音輸入功能導入消費端AI應用與企業用代理程式(Agent)。
根據PANews的報導,於4日(當地時間)指出,Hy ASR 3.0 Preview是以騰訊最新大型語言模型Hy3的語言理解能力為基礎所打造,目的是讓系統能更準確且穩定地將複雜的真實語音轉換成文字,應用場景包括智慧客服、內容理解與語音搜尋等。該模型已率先在騰訊AI應用「元寶」上免費開放,後續也將逐步導入企業用AI產品WorkBuddy。
ASR(自動語音辨識,Automatic Speech Recognition)是將語音轉換為文字的核心技術。當它與大型語言模型結合,就不再只是單純的聽寫工具,而能進一步處理口語化表達、不完整句子與商用情境,成為更貼近實際需求的輸入介面。騰訊先前已將Hy3陸續導入WorkBuddy、CodeBuddy、元寶、Marvis與ima等產品,並透過騰訊雲TokenHub以API形式對外提供。Hy3採用混合專家(MoE)架構,總參數量達2950億個,啟用參數為210億個,並支援256K的上下文長度。這項布局也與騰訊開源模型庫快速擴張的趨勢相互呼應。
根據騰訊雲語音辨識計費文件,即時語音辨識與錄音檔辨識產品皆另外設有「大模型2.0版」項目。即時語音辨識大模型2.0版採後付費制,費率為每小時人民幣1元;一般即時語音辨識提供每月5小時的免費呼叫額度,錄音檔辨識的免費額度則為每月10小時。
不過,騰訊官方新聞室與雲端公開文件目前尚未查到以「Hy ASR 3.0 Preview」為名稱的獨立發表公告,內容中也未提及與區塊鏈、加密貨幣或半導體產業直接相關的合約或數據。整體來看,此次推出的重點仍聚焦於AI輸入介面的升級與企業自動化服務的擴展。
留言 0