Coinbase 過去的支付交易評估顯示,最新版本的 Opus、Sonnet 與 GPT 系列模型,偵測出的詐欺交易筆數及金額都少於前一版本。GPT-5.6 (sol) 提高了標記為詐欺交易的準確度,但找出全部詐欺交易及金額的比例下降。
Coinbase($COIN)於10月7日公布自家評估,比較 Opus 4.5、Opus 5、Sonnet 4.6、Sonnet 5、GPT-5.4 與 GPT-5.6 (sol)。評估重播9週交易紀錄中的1萬6140筆交易,涵蓋7293名使用者及813筆已確認詐欺交易;各模型將風險判定轉為實際封鎖決策的門檻維持一致。
三個系列的最新模型,召回率、F1分數與美元加權召回率都低於前一版本。召回率是模型找出的實際詐欺交易占比;美元加權召回率則是已確認詐欺金額中模型捕捉到的比例。F1分數則同時反映精確率與召回率。
GPT-5.6 (sol) 的精確率較前一版本高11.5個百分點,但召回率低20.7個百分點,美元加權召回率低21.8個百分點。也就是說,模型標記為詐欺的交易更準確,但涵蓋的詐欺交易與損失金額範圍縮小。
Opus 5與Sonnet 5在四項評估指標上都低於前一版本。Opus的召回率下降0.8個百分點;Sonnet的召回率與美元加權召回率則分別下降22.2及22.9個百分點。Coinbase表示,尚未確認下降是否與模型訓練方式或特定變更有關。
這項評估沒有衡量即時服務中客戶的實際損失,而是在相同條件下重新評估過去交易,檢視不同模型版本的差異。評估也未測量以最新AI模型取代整套既有防詐系統後的表現。
Coinbase先前公布的另一項線上實驗,則是在既有機器學習模型與規則之外加入AI審查,結果詐欺交易減少30%、詐欺金額減少22%。該實驗是在既有系統上增添AI審查,測試方式與這次模型版本比較不同。Coinbase先前的防詐實驗與導入AI審查報導也介紹了該項獨立實驗結果。
Coinbase於10月8日公布的另一項評估指出,以詐欺資料進一步訓練的Qwen3.5-9B,在四項偵測指標上都高於Opus 4.5。其F1分數高9.6個百分點,線上推論延遲時間短55%。這項結果同樣以Coinbase自有資料及另一套評估設定為基礎。
這次比較顯示,在特定支付詐欺資料與判定門檻下,更換模型版本可能改變偵測結果。僅憑這項評估,無法判斷相同結果是否適用於其他服務或即時客戶損失。
留言 0