瓦爾斯AI(Vals AI)募得4,000萬美元(約555億韓元)A輪融資,並擴大評估AI模型與代理人實際工作表現的業務,涵蓋法律、金融與程式設計等產業。
瓦爾斯AI於8月13日宣布,在估值4億美元(約5,548億韓元)的基礎上完成A輪融資。安德森·霍洛維茲(Andreessen Horowitz)主導本輪投資,既有投資人8VC、Pear VC、Bloomberg Beta,以及新投資人HRT Ventures、Next Ladder Ventures參與。
TechCrunch報導,瓦爾斯AI成立於2024年,並曾取得由8VC與Bloomberg Beta主導的種子輪融資,金額未公開。
公司並不以開發AI模型本身為主,而是評估模型、代理人與應用服務執行實際工作的能力。評估項目涵蓋法律研究、金融分析、醫療帳單與程式設計,除準確率外,也計算成本、延遲時間、失敗類型與工具使用能力。
核心評估方式是非公開測試集。若公開題目被納入模型訓練資料,或開發商針對題目調整模型,基準測試分數可能無法反映實際表現。
瓦爾斯AI將評估資料分為公開驗證集、非公開驗證集與非公開測試集,並表示正式基準測試分數是以不對外公開的測試集計算。公司表示,非公開題目有助於防止評估資料流入訓練資料。
不過,非公開方式也帶來可重現性的負擔。外部研究人員難以使用相同問題與條件進行實驗,因此瓦爾斯AI公開評估基礎設施與部分工具,補強執行流程的可重現性。
評估範圍也持續擴大。瓦爾斯AI與CoreWeave共同發布RSI Index,評估AI模型是否能進行開發下一代模型所需的研究,並推動網路安全與心理健康相關評估。
瓦爾斯AI也發布Vals Smith。使用者可根據GitHub儲存庫建立客製化程式設計基準測試,早期使用者可獲得120個免費點數。
公司表示,營收較2025年全年增加8倍,客戶基礎增加1倍,員工人數在最近6個月增加3倍。上述數據來自公司公告,是否經過外部審計尚未確認。
Vals Index截至2026年9月15日,根據金融、程式設計與法律工作評估AI代理人的表現,並納入各產業占美國GDP的比重計算綜合分數,當時共有58個模型列入評估。
雷恩·克里希南(Rayan Krishnan) 瓦爾斯AI共同創辦人表示,既有學術基準測試無法快速跟上AI模型發展。他指出,評估不僅要確認模型能否在實際工作中產出接近人類品質的結果,也要衡量模型造成負面結果的可能性。
瓦爾斯AI表示,其評估結果已被OpenAI、Anthropic、Google、Meta與xAI的模型卡引用。不過,投資人與AI企業之間的關係是否影響評估獨立性,仍需要另行驗證。
隨著AI模型開發商與企業客戶增加,比較實際工作表現的共同標準重要性也同步上升。非公開測試集可降低資料污染,但如何兼顧評估結果的透明度與可重現性,仍是瓦爾斯AI需要處理的課題。
瓦爾斯AI表示,將配合本輪融資擴大AI模型評估工具與評估領域,並把範圍從法律、金融與程式設計延伸至醫療與網路安全。
留言 0