AI閘道服務OpenRouter推出全新評測工具「Ori Eval」,讓開發者能依照實際程式碼與工作流程,比較不同AI模型的效能、速度與成本,藉此省去逐一手動測試模型的麻煩,快速找出最適合產品的模型。
OpenRouter於4日(當地時間)在官方部落格表示,「Ori Eval」會直接執行應用程式中的真實提示詞(prompt),檢查工具呼叫與回答品質,藉此提供選擇模型的依據。OpenRouter是一項閘道服務,讓使用者能透過單一API串接多種AI模型。
與公開排行榜替模型排出「通用」名次不同,「Ori Eval」評估的是「哪個模型在特定服務中表現更好」。OpenRouter認為,一般基準測試或社群推薦難以反映個別產品的資料、提示詞與執行環境,這正是「Ori Eval」誕生的出發點。
這款工具會先掃描開發者的程式碼庫,找出呼叫AI模型的位置,藉此建立評測檔案,接著在相同條件下執行候選模型並比較結果。開發者可自行指定準確度、速度、成本、延遲時間與工具呼叫準確度等產品所需的評估標準。
評測過程中,執行環境、模型設定與推理強度都會固定不變,避免候選模型因條件不同而導致結果失真。
評測內容會儲存為「*.eval.ts」格式的程式碼檔案,並以「bun test」指令執行,用來檢查AI代理人是否呼叫了必要工具、是否避開了不該執行的工具,以及是否完整完成回答。若答案沒有標準解,也可以另外交由大型語言模型(LLM)評分。
「Ori Eval」也能把以自然語言描述的錯誤直接轉換成測試。舉例來說,只要輸入「客服代理人未經訂單查詢就處理退款」這類問題,系統就會自動建立一個檢查是否呼叫訂單查詢工具的評測。開發者完成修正後,可重新執行同一項評測,確認問題是否再度發生。
若與「GitHub Actions」串接,這些評測還能當作回歸測試使用:一旦評測失敗,可設定讓持續整合(CI)作業同步失敗,且評測可由人工手動執行,也能依排定時程自動執行。
此次推出顯示OpenRouter的業務版圖,正從單純的模型中繼服務,擴大到開發與維運管理領域。OpenRouter於7月推出追蹤代理人任務與成本的「Classifiers」功能,同時公開以延遲時間、處理量與正常運作時間評估LLM供應商效能的方法。先前,本媒體(TokenPost)曾報導OpenRouter根據大規模請求紀錄,分析AI模型使用量與效能的案例。
OpenRouter與加密貨幣的直接關聯,目前僅止於支付方式。除了信用卡與支付寶(Alipay)之外,OpenRouter也支援與美元價值掛鉤的穩定幣USD Coin(USDC)。「Ori Eval」本身並未被定位為區塊鏈服務或代幣項目。
查證來源:OpenRouter「Ori Eval」部落格、「Ori Eval」技術文件、快速上手指南、常見問題。
留言 0