騰訊(Tencent,0700.HK)混元大型語言模型的後訓練研究員徐燦(Can Xu),近期轉往微信(WeChat)WeLM團隊,主責大型語言模型研發,讓微信從單純的對話式聊天機器人,走向能用自然語言呼叫App功能與小程式的代理式AI,開發路線也隨之更加清晰。
根據科技媒體動察(Beating)報導,徐燦在加入WeLM團隊之前,是姚順雨(Shunyu Yao)接手騰訊混元大型語言模型研發前,負責混元LLM後訓練其中一個方向的研究人員。
所謂「後訓練」,是指讓完成預訓練的大型語言模型,針對指令遵循、對話與工具呼叫等實際服務情境進一步調整。微信若要把AI串進App內部功能呼叫與小程式操作,模型就得具備理解使用者意圖、並拆解執行多個步驟的能力,這也是外界把這次人事異動與代理式AI研究布局連結在一起的原因。
徐燦與微軟(Microsoft,MSFT)的WizardLM專案也有淵源。微軟研究院公開的WizardLM論文,把徐燦列在作者名單第一位,論文中提出的Evol-Instruct方法,能把既有指令改寫成更複雜的指令資料。動察(Beating)指出,徐燦長期投入合成資料、指令訓練與大型語言模型後訓練研究。
微信近期釋出的徵才資訊也指向同一方向。公開職缺顯示,WeLM團隊正在招募推理最佳化與代理研究人才,其中一項職缺需負責通用長時域(Long-Horizon)LLM Agent的訓練策略,代表微信打算在模型訓練階段,就處理好把長任務拆解成多步驟執行的代理能力。
產品端也有相應動作。微信開發者官方管道於6月8日發布的開發者接入指南提到,微信AI目前處於內測階段,小程式開發者可透過「自動模式」與「開發模式」兩種方式接入微信AI生態:自動模式由平台分析小程式原始碼與畫面,讓AI直接操作;開發模式則由開發者另外開發功能,經過評測與審核後,再交給AI呼叫。
微信自家AI助理「小微」也已進入小規模測試階段。騰訊客服說明,小微可透過文字或語音對話操作微信的基本功能,並呼叫小程式。從目前公開資訊來看,小微比起獨立App,更像是把微信內部功能用自然語言串連起來的入口。
模型研究同步進行中。騰訊微信AI團隊公開的Hidden Decoding資料庫顯示,7月7日新增了WeLM-HD4-80B與WeLM-HD4-617B的實驗結果,該資料庫介紹的方法,是在維持相同Transformer架構的前提下,提高每個token的潛在運算量。
從外部角度看,這反映出中國大型平台正把AI直接嵌進既有的即時通訊與小程式生態,而不是另外推出獨立服務。本媒體先前也報導過,中國AI企業不只停留在基礎模型競爭,重心正逐漸轉向執行層的趨勢。目前可確認的範圍,僅止於微信同時在WeLM、後訓練與代理訓練策略上齊頭並進。
留言 0