AI評估新創「Vals AI」完成4000萬美元A輪融資,投後估值達到4億美元,並同步擴大AI評估產品線。
根據Vals AI於13日在官方部落格公布的內容,這輪融資由a16z(Andreessen Horowitz)領投,既有投資人8VC、Pear VC、Bloomberg Beta,以及新加入的HRT Ventures、Next Ladder Ventures皆參與其中。
Vals AI表示,募得的資金將用於擴充衡量AI模型與代理人(agent)實際工作表現的基準測試與評估基礎設施。公司指出,模型開發速度遠遠超前於可信評估體系的建立,這正是這輪募資的背景。
Vals AI說明,公司以模型能否完成律師、銀行員、工程師、醫師等實際職務為標準進行評估。為避免公開試題混入訓練資料而影響評分準確性,計分時採用非公開的測試題庫。
Vals AI指出,其評估結果已被OpenAI、Anthropic、Google、Meta、xAI等公司引用於各自的模型卡(model card)中。企業客戶則利用這些評估結果比較不同模型,並在正式導入前檢視效能、成本、延遲與失敗類型等面向。
此次發表也包含新產品。「Vals Smith」是一款能依據GitHub儲存庫打造客製化程式碼基準測試的工具。
使用者可連接公開或私有儲存庫,選定要評估的模型與代理人,再比較各項任務的通過率。Vals AI說明,這項工具會把已合併的Pull Request轉換成獨立任務,並透過隱藏測試檢驗模型實際的修改能力。
公司同時推出「前沿風險」(frontier risk)基準測試系列,新產品線包括與雲端運算業者CoreWeave合作開發的RSI Index、網路安全基準測試,以及與心理健康相關的初期研究項目。
「Vals Index」也升級至2.0版本。Vals AI表示,此次改版擴大了對整體經濟層面的評估範圍。
Vals AI表示,公司營收較2025全年成長8倍,客戶數翻倍,團隊規模在近6個月內成長為三倍。這些數字均為公司自行公布,尚未經第三方查證。
AI評估基礎設施吸引資金投入,反映出AI競爭焦點正從模型效能本身,轉向實際工作表現的驗證。AI代理人基礎設施業者近期陸續完成A輪融資並推出新產品的趨勢,也是同一脈絡下的延伸。
對企業而言,導入AI模型前不能只看準確度,還須一併考量營運成本、回應延遲與失敗風險。Vals AI此次募資顯示,生成式AI市場對「可驗證評估體系」的需求正持續升高。
留言 0