Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

OpenRouter推出「Ori Eval」 用真實工作流程評測AI模型

AI閘道服務OpenRouter推出全新評測工具「Ori Eval」,讓開發者能依照實際程式碼與工作流程,比較不同AI模型的效能、速度與成本,藉此省去逐一手動測試模型的麻煩,快速找出最適合產品的模型。

OpenRouter於4日(當地時間)在官方部落格表示,「Ori Eval」會直接執行應用程式中的真實提示詞(prompt),檢查工具呼叫與回答品質,藉此提供選擇模型的依據。OpenRouter是一項閘道服務,讓使用者能透過單一API串接多種AI模型。

與公開排行榜替模型排出「通用」名次不同,「Ori Eval」評估的是「哪個模型在特定服務中表現更好」。OpenRouter認為,一般基準測試或社群推薦難以反映個別產品的資料、提示詞與執行環境,這正是「Ori Eval」誕生的出發點。

這款工具會先掃描開發者的程式碼庫,找出呼叫AI模型的位置,藉此建立評測檔案,接著在相同條件下執行候選模型並比較結果。開發者可自行指定準確度、速度、成本、延遲時間與工具呼叫準確度等產品所需的評估標準。

評測過程中,執行環境、模型設定與推理強度都會固定不變,避免候選模型因條件不同而導致結果失真。

評測內容會儲存為「*.eval.ts」格式的程式碼檔案,並以「bun test」指令執行,用來檢查AI代理人是否呼叫了必要工具、是否避開了不該執行的工具,以及是否完整完成回答。若答案沒有標準解,也可以另外交由大型語言模型(LLM)評分。

「Ori Eval」也能把以自然語言描述的錯誤直接轉換成測試。舉例來說,只要輸入「客服代理人未經訂單查詢就處理退款」這類問題,系統就會自動建立一個檢查是否呼叫訂單查詢工具的評測。開發者完成修正後,可重新執行同一項評測,確認問題是否再度發生。

若與「GitHub Actions」串接,這些評測還能當作回歸測試使用:一旦評測失敗,可設定讓持續整合(CI)作業同步失敗,且評測可由人工手動執行,也能依排定時程自動執行。

此次推出顯示OpenRouter的業務版圖,正從單純的模型中繼服務,擴大到開發與維運管理領域。OpenRouter於7月推出追蹤代理人任務與成本的「Classifiers」功能,同時公開以延遲時間、處理量與正常運作時間評估LLM供應商效能的方法。先前,本媒體(TokenPost)曾報導OpenRouter根據大規模請求紀錄,分析AI模型使用量與效能的案例

OpenRouter與加密貨幣的直接關聯,目前僅止於支付方式。除了信用卡與支付寶(Alipay)之外,OpenRouter也支援與美元價值掛鉤的穩定幣USD Coin(USDC)。「Ori Eval」本身並未被定位為區塊鏈服務或代幣項目。

查證來源:OpenRouter「Ori Eval」部落格「Ori Eval」技術文件快速上手指南常見問題

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1