AI新創公司TrueFoundry推出開源「代理」執行框架TrueForge,並表示在同款模型的條件下,企業AI代理的作業成本可降低約30%,若改用開源模型,最高可省下約75%。
TrueFoundry於8月19日發表TrueForge,強調這是一套「廠商中立」的執行層。官方將TrueForge定位為讓大型語言模型(LLM)真正完成任務的運行環境,整合了模型呼叫、工具串接、沙盒執行、審核流程、上下文管理與工作階段狀態等功能。
TrueForge提供聊天介面、HTTP API、TypeScript SDK,以及可嵌入的UI SDK等多種使用方式。其程式碼庫中附有benchmark測試目錄,並標示採用MIT授權。
根據官方公布的詳細測試,TrueForge在14項企業級任務中與Claude代管代理(Claude Managed Agent)進行比較。在同樣使用Opus 4.8模型的條件下,Claude代管代理平均完成10.7項任務,單次執行成本為11.8美元。
相同條件下,TrueForge同樣平均完成10.7項任務,但單次執行成本僅8.6美元。若改用GLM-5.2模型,TrueForge平均完成任務數提高至11.7項,單次執行成本則降至3.0美元。
TrueFoundry說明,測試採用相同工具、相同系統提示詞與全新工作階段,並以n=3重複測試取平均值,結果由獨立的LLM評分機制判定。
評論:這次成本差異的關鍵,並非只在於模型本身的價格。同款模型比較下成本仍出現落差,顯示代理執行迴圈的精簡程度,同樣會直接影響整體成本結構。
所謂「代理框架」,與開發者單純下指令的工具不同,它是一個能讀取檔案、呼叫外部工具、在必要時等待人工核准,並維持長時間作業狀態的中介層。
這股趨勢也與基礎模型競爭之外、重心逐漸轉向實際任務執行層的走向相呼應。在企業AI代理領域,除了模型效能本身,工具開放範圍、上下文組成方式、重試機制與審核流程,同樣左右著營運成本與可控程度。
本站此前也曾報導企業AI代理實驗中執行架構如何改變單次作業成本的案例,當時Writer公司表示,其Palmyra X6模型的單次作業成本降低了52%。
TrueFoundry官網首頁以「50% lower cost」一句話概括TrueForge的優勢,不過詳細測試報告則依條件分別列出數字:同款模型比較約降30%,改用GLM-5.2比較則最高約降75%。
評論:若只擷取單一數字閱讀,容易忽略實際測試條件。是否使用同款模型、是否改用開源模型,以及每項任務的工具呼叫次數與上下文長度,都會讓成本節省幅度出現差異。
TrueForge的程式碼庫公開後,在GitHub上短時間內累積約1900顆星標與129次分支。開發者社群展現初期關注,但這尚不能直接等同於實際營收轉換或企業導入規模的擴大。
此次測試使用了DevRev公開的Enterprise-Bench L1-L2資料集,該資料庫說明自身為2026年7月公開、涵蓋14項企業AI代理任務的測試基準。
目前公布的成本節省幅度,是TrueFoundry自行發布的測試結果。在實際客戶環境中,模型選擇、上下文長度、工具呼叫次數、是否使用沙盒,以及流量模式等因素,都可能使實際成本出現不同。
留言 0