Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

Coinbase 回測:GPT 欺詐交易召回率下降20.7個百分點

在支付終端機旁檢視交易紀錄 / TokenPost.ai

Coinbase 過去的支付交易評估顯示,最新版本的 Opus、Sonnet 與 GPT 系列模型,偵測出的詐欺交易筆數及金額都少於前一版本。GPT-5.6 (sol) 提高了標記為詐欺交易的準確度,但找出全部詐欺交易及金額的比例下降。

Coinbase($COIN)於10月7日公布自家評估,比較 Opus 4.5、Opus 5、Sonnet 4.6、Sonnet 5、GPT-5.4 與 GPT-5.6 (sol)。評估重播9週交易紀錄中的1萬6140筆交易,涵蓋7293名使用者及813筆已確認詐欺交易;各模型將風險判定轉為實際封鎖決策的門檻維持一致。

三個系列的最新模型,召回率、F1分數與美元加權召回率都低於前一版本。召回率是模型找出的實際詐欺交易占比;美元加權召回率則是已確認詐欺金額中模型捕捉到的比例。F1分數則同時反映精確率與召回率。

GPT-5.6 (sol) 的精確率較前一版本高11.5個百分點,但召回率低20.7個百分點,美元加權召回率低21.8個百分點。也就是說,模型標記為詐欺的交易更準確,但涵蓋的詐欺交易與損失金額範圍縮小。

Opus 5與Sonnet 5在四項評估指標上都低於前一版本。Opus的召回率下降0.8個百分點;Sonnet的召回率與美元加權召回率則分別下降22.2及22.9個百分點。Coinbase表示,尚未確認下降是否與模型訓練方式或特定變更有關。

這項評估沒有衡量即時服務中客戶的實際損失,而是在相同條件下重新評估過去交易,檢視不同模型版本的差異。評估也未測量以最新AI模型取代整套既有防詐系統後的表現。

Coinbase先前公布的另一項線上實驗,則是在既有機器學習模型與規則之外加入AI審查,結果詐欺交易減少30%、詐欺金額減少22%。該實驗是在既有系統上增添AI審查,測試方式與這次模型版本比較不同。Coinbase先前的防詐實驗與導入AI審查報導也介紹了該項獨立實驗結果。

Coinbase於10月8日公布的另一項評估指出,以詐欺資料進一步訓練的Qwen3.5-9B,在四項偵測指標上都高於Opus 4.5。其F1分數高9.6個百分點,線上推論延遲時間短55%。這項結果同樣以Coinbase自有資料及另一套評估設定為基礎。

這次比較顯示,在特定支付詐欺資料與判定門檻下,更換模型版本可能改變偵測結果。僅憑這項評估,無法判斷相同結果是否適用於其他服務或即時客戶損失。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1