近日有調查報導顯示,多家頭部 AI 企業正通過中間商秘密採購數百萬本二手書籍,掃描提取內容作為 AI 模型訓練數據,完成數碼化後將實體書銷毀。AI 模型訓練需要大量高質量的原創數據,但目前網絡上存在大量低質量 AI 生成內容,會污染訓練數據池,影響模型訓練效果。因此,AI 企業將目光轉向 2022 年之前出版的紙質印刷書籍,這類內容大多為人類原創,受 AI 生成內容污染的概率更低。
此前已有相關案例出現,AI 企業 Anthropic 曾投入數百萬美元,採購大量紙質書籍提取信息訓練 Claude 模型,掃描後將實體書銷毀。該公司曾因存儲 700 萬本盜版書籍用於訓練,被處以 15 億美元罰款。近期也有出版聯盟起訴 Google,指控其非法使用數百萬本版權書籍訓練 Gemini 模型。
AI 企業正秘密採購二手書籍進行模型訓練
據書籍數據庫平台 ISBNdb 的數據,今年 4 月起二手書批量訂單明顯增長,單筆訂單規模從 1000 本到 100 萬本不等,採購沒有特定的題材、類型或作者傾向,且採購方對價格不敏感,即使溢價也會直接購買。有二手書賣家透露,此前銷量好時每週能賣出約 20 本書,近期每週銷量暴漲至數百本,是常規銷量的五倍,其他二手書平台也出現了類似的批量訂單增長。
為了提高效率、降低成本,AI 企業大多選擇破壞性掃描方案,拆除書籍裝訂後將單頁送入高速工業掃描儀掃描,最終導致數百萬本實體書被銷毀。目前爭議主要集中於兩方面:一是 AI 企業掃描過程中是否會篩選稀有或絕版書籍,這類書籍退出流通可能造成公共文化資源損失;二是掃描後的書籍內容會進入私有數據庫用於 AI 訓練,普通公眾無法訪問,相關知識不能被社會共享。

