Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

28%通過率引關注:百萬token免費模型Ox Alpha

筆記型電腦旁放著模型比較備忘錄/TokenPost.ai

Ox Alpha以免費定價與百萬級token上下文為賣點,登上開發者社群的檢驗台。有人稱它勝過Claude Fable 5,但公開測試結果因測試方式不同而出現分歧。

OpenRouter於24日在模型頁面介紹Ox Alpha,將其定位為適用於coding、長時間agent作業與生產環境的推理模型。模型識別碼為「stealth/ox-alpha」,輸入與輸出價格皆為每百萬token 0美元,上下文長度標示為1.05M。

OpenRouter說明,該模型由匿名第三方提供者開發與營運。OpenRouter僅負責路由請求,並非開發商或所有者,提供者會保存使用者的提示詞(prompt)與回覆內容。

話題性不只來自免費定價。獨立介紹網站oxalpha.com指出,Ox Alpha支援1,048,576 token上下文、最高131,072 token輸出,並可輸入文字、圖片與影片。

同一網站表示,在10項實戰coding任務中,Ox Alpha解決了其中8項。作為比較,該網站列出Claude Fable 5為65%、GLM-5為62%、GPT-5為52%、Grok 4為62%。

不過,這項結果很難視為全面性能優勢的證明。另一個獨立基準測試庫以LiveCodeBench release_v6的175道題目、單次嘗試(single-attempt)條件進行評測,結果顯示Ox Alpha的pass@1為28.0%,175題中答對49題。

該基準測試庫並補充解讀稱,在其自訂評測條件下,Ox Alpha看起來更像小型模型,而非「前沿(frontier)」定位的模型。10項任務樣本與175題基準測試的樣本規模與條件並不相同,因此無法保證得出相同結論。

作為比較對象的Claude Fable 5,是Anthropic於6月9日公開的模型。Anthropic在官方頁面公告,已於7月1日恢復存取,價格為輸入每百萬token 10美元、輸出每百萬token 50美元。

Claude Fable 5主打coding與長時間agent作業。由於Ox Alpha瞄準相同領域,兩款模型因此在開發者社群中被直接放在一起比較。

關於開發主體的猜測也持續不斷。TechCrunch報導,早期猜測多集中在中國Z.ai的GLM系列,隨後也有人提出微軟(MSFT)旗下MAI的可能性。

但官方說明目前仍僅止於「匿名第三方提供者」這個程度。Coinbase(COIN)的預測市場上甚至出現「哪家公司是Ox Alpha背後主導者」的競猜項目,不過預測市場的價格並非官方證實。

使用量數據則顯示出初期的市場關注度。在OpenRouter公布的2026年8月coding模型排行榜上,Ox Alpha以7.51T tokens排名第二;在tool-calling模型清單中,使用量則標示為16.7T tokens。

OpenRouter說明,這項排名是依據實際使用量計算。不過使用量與性能認證並非同一件事,免費提供的條件是否推高了初期呼叫量,也是需要一併考量的因素。

模型路由平台是讓開發者能在單一API介面中比較、呼叫多款AI模型的基礎設施。開發者可依價格、上下文長度、輸入格式與是否支援工具呼叫(tool calling)自由切換模型,但在正式營運環境中,資料保存條件與提供者可信度,和性能同樣重要。

這起事件延續本站先前的報導——OpenRouter曾以免費測試形式公開匿名AI模型Ox Alpha。當時的焦點在於匿名公開方式與營運條件,如今討論則轉向性能宣稱與獨立評測結果是否一致。

評論:對想把免費、匿名模型導入實際工作的讀者而言,資料處理條件才是關鍵變數。既然OpenRouter已表明提示詞與回覆會保存在提供者端,在涉及內部程式碼或客戶資料的環境中,使用前應優先確認營運與資料保存條件,而非只看價格。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1