亞馬遜(Amazon,AMZN)被爆出大量收購稀有及絕版書籍,掃描做為人工智慧(AI)訓練資料後便銷毀原書。這起事件讓外界關注到,AI業者取得訓練資料的範圍已從網路內容延伸到實體知識資產,爭議也隨之擴大。
科技媒體404 Media報導,加州一名書商寄出的約1000本書籍包裹,被追蹤送往亞馬遜位於拉斯維加斯的VGT3物流中心。404 Media透過AirTag確認了運送路線,並指出該設施為提升掃描速度,會先將書籍裝訂裁切開來再進行處理。
亞馬遜承認公司會為「技術相關工作」收購書籍,但未公開收購規模,也未說明掃描後的資料用於哪些AI服務。報導同時指出,書籍掃描完成後,原始實體書便遭到銷毀。
爭議焦點不在於書籍的所有權,而在於取得訓練資料的方式。報導提及的書籍多為2022年以前出版的作品,原因在於生成式AI尚未普及前所寫成的文字,如今成為業者急欲取得的資源。
若AI生成的文字混入訓練資料,恐拖累模型品質,這樣的疑慮也推升了對「純人類撰寫文本」的需求。對AI開發商而言,僅靠網路公開文字,很難同時迴避著作權、品質與重複內容等問題。
問題出在「破壞式掃描」的做法。相較於逐頁翻拍,把裝訂裁開、將書頁拆成散頁後送入高速掃描機,處理速度確實更快,但原書因此無法保存。
稀有及絕版書籍往往難以再次取得,這也讓爭議不只停留在資料蒐集層面。除了著作權問題外,外界也擔憂文化保存的價值可能因此受損。
類似做法先前也出現在Anthropic身上。據指出,Anthropic在建構Claude模型的過程中,曾大量收購紙本書籍,拆除裝訂後進行掃描,並在事後銷毀原書。
不過,這次亞馬遜的報導與Anthropic的案例屬於各自獨立的事件,亞馬遜收購書籍的規模及掃描資料的實際用途,仍須另行確認。
美國法院此前在Anthropic著作權訴訟案中認定,將合法購入的書籍掃描用於AI訓練、再銷毀原書的做法,在特定條件下可能屬於合理使用。不過,這項判決並未一併解決稀有書籍的保存問題,著作權訴訟的爭點與文化保存的爭點並不相同。
對台灣讀者來說,這起事件也不只是海外科技巨頭的單一爭議。亞馬遜旗下的Twitch,先前就曾因將創作者內容預設用於生成式AI訓練而引發批評。
如果說Twitch事件凸顯的是使用者內容同意機制的問題,這次書籍收購的報導則把問題延伸到實體資料的保存方式。AI業者之間的資料競賽,正同時牽動創作者同意、著作權,以及文化資產保存標準等議題。
亞馬遜的書籍收購規模、掃描資料的具體用途,以及遭銷毀書籍的稀有程度,目前都尚未公開。這起報導顯示,AI訓練資料的爭奪戰,已從網路貼文、影片、聊天紀錄,延伸到印刷品保存的問題。
留言 0