Coinbase($COIN)以自有詐欺資料進一步訓練的 AI 模型 Qwen3.5-9B,在該公司 Onramp 詐欺偵測基準測試的 4 項指標中,得分都高於 Opus 4.5。這項比較僅適用於 Coinbase 未公開的內部評估。
Coinbase 於 8 日在「Owning Intelligence」技術部落格系列中表示,已針對 Onramp 詐欺偵測對 Qwen3.5-9B 進行後訓練。在公司基準測試中,精確率高出 7.5 個百分點、召回率高出 12.0 個百分點、F1 分數高出 9.6 個百分點,詐欺金額加權召回率則高出 35.4 個百分點。這些數字代表百分點差異,並非相對增幅。
Onramp 是讓使用者以法定貨幣購買加密貨幣的服務。根據 Coinbase 公開的系統架構,AI 代理會進一步分類通過既有機器學習模型與規則篩選的交易風險,並回傳風險等級。最終交易判斷仍由既有系統負責,而非 AI 代理。
Qwen3.5-9B 是一款擁有 90 億個參數的開放權重模型。Coinbase 使用自有詐欺資料及以結果為基礎的獎勵方法 RLVR(可驗證獎勵強化學習)訓練模型,並採用 SkyRL、Anyscale 環境與 LoRA 方法。
Coinbase 表示,使用單張 NVIDIA RTX PRO 6000 96GB GPU 的訓練成本不到 100 美元。公司未說明這筆費用是否包含資料準備、工程、人力營運及重新訓練成本。
線上推論延遲比較中,Qwen 的中位數(P50)為 0.683 秒,Opus 4.5 為 1.515 秒;第 99 百分位(P99)延遲則分別為 1.036 秒與 3.312 秒。Coinbase 表示,延遲與偵測效能是在不同評估中測量。
這次結果與先前的線上 A/B 測試不同。Coinbase 曾公布,在既有機器學習模型與規則之外加入 LLM 風險評估代理後,詐欺交易筆數減少 30%,詐欺金額減少 22%。這些數字是該代理導入實驗的結果,並不代表 Qwen3.5-9B 單獨的成效。
由於基準測試與交易資料未公開,外部難以在相同條件下重現結果。因此,這項比較僅能視為 Coinbase 針對 Onramp 特定詐欺分類任務、依其評估標準得出的結果。本刊先前也曾報導,Coinbase 的 AI 代理支援交易與金融工作流程的功能已可透過 Grok 使用。
留言 0