通過Cloudflare($NET)網路的網站請求中,機器人請求占比在2026年5月達到約60%,比公司原先預期機器人與AI代理流量超越人工流量的時間早約1年。
Cloudflare執行長馬修·普林斯(Matthew Prince)主張,AI企業應為模型開發所使用的內容與網路基礎設施付費。《財富》報導,普林斯表示,AI爬蟲取得網站內容,卻不一定為網站帶來實際訪客,可能損害依賴廣告與訂閱收入的網站商業模式。
不過,這裡所說的60%並非全體網路使用者的比例,而是Cloudflare網路觀測到的網站請求占比。機器人分類可能包括AI訓練爬蟲、搜尋引擎爬蟲、安全掃描器與API請求等多種自動化請求。
因此,機器人請求多於人工請求,不代表實際訪客數或獨立使用者數已超過人類。高頻率自動化程式對統計結果造成的影響,也需要一併考量。
Cloudflare於9月15日推出「Disallow AI Training」設定,讓網站營運者在允許搜尋爬取的同時,限制AI訓練用途的存取。過去搜尋與AI訓練有時由同一個爬蟲執行,若全面阻擋,可能連搜尋曝光也一併減少。
新設定將爬蟲目的區分為搜尋(Search)、訓練(Training)與代理(Agent)流量。網站營運者可維持搜尋索引,同時限制模型訓練所需的存取。
Cloudflare表示,蘋果、Google與微軟已同意遵守相關設定,或將在一定期限內提供支援。對於Applebot、Googlebot與Bingbot等同時執行搜尋與訓練的爬蟲,網站營運者可只限制訓練用途的存取。
Cloudflare表示,亞馬遜、Anthropic、Meta與OpenAI的訓練專用爬蟲已與搜尋功能分離,因此即使封鎖,也不會影響搜尋曝光。微軟目前正開發透過robots.txt支援拒絕AI訓練訊號的功能,目標於2027年初推出。
Cloudflare表示,不到1%的網站會封鎖搜尋機器人,但已有17%的網站部分啟用AI訓練封鎖功能。這顯示不少營運者希望維持搜尋流量,同時對AI訓練存取行使獨立選擇權。
Cloudflare表示,截至2025年6月,OpenAI的爬取與推薦導流比例為1700比1,Anthropic則為7萬3000比1。這些數字反映AI爬蟲大規模收集內容,與訪客回到原始網站之間存在落差。
這種結構可能與以廣告及訂閱為主要收入來源的網站利益衝突。搜尋引擎收集內容後,通常會透過搜尋結果將訪客帶回網站;AI訓練爬蟲則可能將內容納入模型,卻不把讀者導回原始網站。
Cloudflare於2025年7月也公布「Pay Per Crawl」構想,由網站營運者設定AI爬蟲的存取價格,AI企業支付內容存取費。
不過,目前參與企業、不同內容的價格及收益分配方式都尚未確定。即使AI企業支付使用費,也不代表所有內容創作者都會自動獲得補償,合約條件與分配結構仍需另行協商。
僅靠robots.txt也難以控制所有爬蟲的存取。Cloudflare說明,robots.txt並非用來確認爬蟲身分與存取目的,也無法強制執行違反指示的行為。
正如Twitch預設允許AI訓練、引發創作者反彈的案例,內容提供者能否自行選擇是否允許訓練,已成為業界爭議焦點。Cloudflare的新設定則是透過技術方式,將搜尋曝光與AI訓練同意分開處理。
Cloudflare正擴大區分搜尋、訓練與代理流量的控管體系,微軟則以2027年初支援基於robots.txt的訓練拒絕訊號為目標。「Pay Per Crawl」的實際採用規模與內容費用分配方式,仍有待後續協商。
留言 0