Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

2026年5月機器人請求占比近60% Cloudflare要求AI訓練付費

調整爬蟲存取設定的網站營運者雙手 / TokenPost.ai

通過Cloudflare($NET)網路的網站請求中,機器人請求占比在2026年5月達到約60%,比公司原先預期機器人與AI代理流量超越人工流量的時間早約1年。

Cloudflare執行長馬修·普林斯(Matthew Prince)主張,AI企業應為模型開發所使用的內容與網路基礎設施付費。《財富》報導,普林斯表示,AI爬蟲取得網站內容,卻不一定為網站帶來實際訪客,可能損害依賴廣告與訂閱收入的網站商業模式。

不過,這裡所說的60%並非全體網路使用者的比例,而是Cloudflare網路觀測到的網站請求占比。機器人分類可能包括AI訓練爬蟲、搜尋引擎爬蟲、安全掃描器與API請求等多種自動化請求。

因此,機器人請求多於人工請求,不代表實際訪客數或獨立使用者數已超過人類。高頻率自動化程式對統計結果造成的影響,也需要一併考量。

Cloudflare於9月15日推出「Disallow AI Training」設定,讓網站營運者在允許搜尋爬取的同時,限制AI訓練用途的存取。過去搜尋與AI訓練有時由同一個爬蟲執行,若全面阻擋,可能連搜尋曝光也一併減少。

新設定將爬蟲目的區分為搜尋(Search)、訓練(Training)與代理(Agent)流量。網站營運者可維持搜尋索引,同時限制模型訓練所需的存取。

Cloudflare表示,蘋果、Google與微軟已同意遵守相關設定,或將在一定期限內提供支援。對於Applebot、Googlebot與Bingbot等同時執行搜尋與訓練的爬蟲,網站營運者可只限制訓練用途的存取。

Cloudflare表示,亞馬遜、Anthropic、Meta與OpenAI的訓練專用爬蟲已與搜尋功能分離,因此即使封鎖,也不會影響搜尋曝光。微軟目前正開發透過robots.txt支援拒絕AI訓練訊號的功能,目標於2027年初推出。

Cloudflare表示,不到1%的網站會封鎖搜尋機器人,但已有17%的網站部分啟用AI訓練封鎖功能。這顯示不少營運者希望維持搜尋流量,同時對AI訓練存取行使獨立選擇權。

Cloudflare表示,截至2025年6月,OpenAI的爬取與推薦導流比例為1700比1,Anthropic則為7萬3000比1。這些數字反映AI爬蟲大規模收集內容,與訪客回到原始網站之間存在落差。

這種結構可能與以廣告及訂閱為主要收入來源的網站利益衝突。搜尋引擎收集內容後,通常會透過搜尋結果將訪客帶回網站;AI訓練爬蟲則可能將內容納入模型,卻不把讀者導回原始網站。

Cloudflare於2025年7月也公布「Pay Per Crawl」構想,由網站營運者設定AI爬蟲的存取價格,AI企業支付內容存取費。

不過,目前參與企業、不同內容的價格及收益分配方式都尚未確定。即使AI企業支付使用費,也不代表所有內容創作者都會自動獲得補償,合約條件與分配結構仍需另行協商。

僅靠robots.txt也難以控制所有爬蟲的存取。Cloudflare說明,robots.txt並非用來確認爬蟲身分與存取目的,也無法強制執行違反指示的行為。

正如Twitch預設允許AI訓練、引發創作者反彈的案例,內容提供者能否自行選擇是否允許訓練,已成為業界爭議焦點。Cloudflare的新設定則是透過技術方式,將搜尋曝光與AI訓練同意分開處理。

Cloudflare正擴大區分搜尋、訓練與代理流量的控管體系,微軟則以2027年初支援基於robots.txt的訓練拒絕訊號為目標。「Pay Per Crawl」的實際採用規模與內容費用分配方式,仍有待後續協商。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1