Ox Alpha以免費定價與百萬級token上下文為賣點,登上開發者社群的檢驗台。有人稱它勝過Claude Fable 5,但公開測試結果因測試方式不同而出現分歧。
OpenRouter於24日在模型頁面介紹Ox Alpha,將其定位為適用於coding、長時間agent作業與生產環境的推理模型。模型識別碼為「stealth/ox-alpha」,輸入與輸出價格皆為每百萬token 0美元,上下文長度標示為1.05M。
OpenRouter說明,該模型由匿名第三方提供者開發與營運。OpenRouter僅負責路由請求,並非開發商或所有者,提供者會保存使用者的提示詞(prompt)與回覆內容。
話題性不只來自免費定價。獨立介紹網站oxalpha.com指出,Ox Alpha支援1,048,576 token上下文、最高131,072 token輸出,並可輸入文字、圖片與影片。
同一網站表示,在10項實戰coding任務中,Ox Alpha解決了其中8項。作為比較,該網站列出Claude Fable 5為65%、GLM-5為62%、GPT-5為52%、Grok 4為62%。
不過,這項結果很難視為全面性能優勢的證明。另一個獨立基準測試庫以LiveCodeBench release_v6的175道題目、單次嘗試(single-attempt)條件進行評測,結果顯示Ox Alpha的pass@1為28.0%,175題中答對49題。
該基準測試庫並補充解讀稱,在其自訂評測條件下,Ox Alpha看起來更像小型模型,而非「前沿(frontier)」定位的模型。10項任務樣本與175題基準測試的樣本規模與條件並不相同,因此無法保證得出相同結論。
作為比較對象的Claude Fable 5,是Anthropic於6月9日公開的模型。Anthropic在官方頁面公告,已於7月1日恢復存取,價格為輸入每百萬token 10美元、輸出每百萬token 50美元。
Claude Fable 5主打coding與長時間agent作業。由於Ox Alpha瞄準相同領域,兩款模型因此在開發者社群中被直接放在一起比較。
關於開發主體的猜測也持續不斷。TechCrunch報導,早期猜測多集中在中國Z.ai的GLM系列,隨後也有人提出微軟(MSFT)旗下MAI的可能性。
但官方說明目前仍僅止於「匿名第三方提供者」這個程度。Coinbase(COIN)的預測市場上甚至出現「哪家公司是Ox Alpha背後主導者」的競猜項目,不過預測市場的價格並非官方證實。
使用量數據則顯示出初期的市場關注度。在OpenRouter公布的2026年8月coding模型排行榜上,Ox Alpha以7.51T tokens排名第二;在tool-calling模型清單中,使用量則標示為16.7T tokens。
OpenRouter說明,這項排名是依據實際使用量計算。不過使用量與性能認證並非同一件事,免費提供的條件是否推高了初期呼叫量,也是需要一併考量的因素。
模型路由平台是讓開發者能在單一API介面中比較、呼叫多款AI模型的基礎設施。開發者可依價格、上下文長度、輸入格式與是否支援工具呼叫(tool calling)自由切換模型,但在正式營運環境中,資料保存條件與提供者可信度,和性能同樣重要。
這起事件延續本站先前的報導——OpenRouter曾以免費測試形式公開匿名AI模型Ox Alpha。當時的焦點在於匿名公開方式與營運條件,如今討論則轉向性能宣稱與獨立評測結果是否一致。
評論:對想把免費、匿名模型導入實際工作的讀者而言,資料處理條件才是關鍵變數。既然OpenRouter已表明提示詞與回覆會保存在提供者端,在涉及內部程式碼或客戶資料的環境中,使用前應優先確認營運與資料保存條件,而非只看價格。
留言 0