IT 之家 7 月 28 日消息,AI 公司在推动内存和存储资源日益紧张之后,如今似乎又将目光投向了人类的文学遗产。调查媒体 404 Media 最新报道称,多家 AI 公司正通过中间商大规模收购二手图书,以获取高质量训练数据用于训练 AI 模型,同时避免引发公众舆论反弹。

事实上,AI 公司利用纸质图书训练模型已有先例。作为当前卷入版权诉讼的主要 AI 公司之一,Anthropic 曾投入数百万美元购买大量纸质图书,用于提取内容训练 Claude AI 模型,随后再将这些图书销毁。据悉,该公司从 Better World Books 大量采购图书。法院虽然认定,将正版图书用于 AI 训练属于版权法中的 " 合理使用 ",但 Anthropic 因长期保存一个包含 700 万本盗版图书的数据库,侵犯了作者和出版商版权,最终被判赔偿高达 15 亿美元(IT 之家注:现汇率约合 101.62 亿元人民币)。
类似争议也发生在谷歌身上。近期,一个出版商联盟已对谷歌提起诉讼,指控其未经授权使用数百万本受版权保护的图书训练 Gemini AI 模型。
拥有超过 1.11 亿本图书目录信息的在线数据库 ISBNdb,长期以来一直是书商、图书馆和发行商的重要平台。随着 AI 行业迅速发展,ISBNdb 也开始调整业务方向,推出专门面向 AI 企业的大规模图书采购服务。
404 Media 报道称,相关订单规模从一次采购 1000 本到一次采购 100 万本不等。
一位不愿透露姓名的职业书商表示,今年 4 月以来,图书销量出现了前所未有的增长。过去生意好的时候,一周只能卖出约 20 本书;而近几个月,每周销量已飙升至数百本,是平时销量的约五倍。
Alibris、Biblio 等二手书交易平台上的其他书商,也反映出现了类似的大宗采购现象。
尽管目前没有确凿证据证明这些采购行为一定来自 ISBNdb 或某家 AI 公司,但其中存在不少异常现象。例如,大规模采购的对象几乎全部都是带有国际标准书号(ISBN)的图书,这种由 13 位数字组成的编码是全球图书唯一识别标识。
此外,这些采购行为几乎没有任何主题、类型或作者偏好,无论是小说、教材还是专业书籍都在采购范围内。更令人意外的是,买家似乎完全不在意价格,即使部分图书明显高于市场价,也会直接买下。
在 Anthropic 的版权诉讼过程中,曾参与 Google Books 项目、后来负责 Anthropic" 巴拿马计划(Project Panama)" 数字化项目的汤姆 · 哈维(Tom Harvey)证实,Anthropic 曾聘请多家专业文档扫描公司对纸质图书进行数字化处理。
其中一家合作公司是 Datamation Information Services,该公司提供非破坏性扫描和破坏性扫描两种图书数字化服务。
非破坏性扫描通常使用俯拍扫描仪、平板扫描仪或 V 型扫描设备,在不拆解图书的情况下完成数字化。而破坏性扫描则会直接拆开书籍,将每一页送入高速工业扫描仪进行处理。
由于破坏性扫描效率更高、成本更低,因此 AI 公司普遍选择这一方式,最终导致数百万本纸质图书被拆毁。
毫无疑问,纸质图书对于 AI 来说是一座巨大的知识宝库。然而,这种做法也引发了越来越多的伦理争议。
批评者认为,目前尚不清楚 AI 公司在数字化过程中,是否会区分普通图书与珍贵图书、绝版图书。如果这些稀有书籍被拆毁,它们可能将永久退出流通。
另一个更大的问题在于,这些扫描后的内容最终都会进入 AI 公司的私有数据库,仅用于训练 AI,而普通公众无法访问。
这意味着,人们或许能够获得更加智能的 AI,但代价可能是,人类积累的大量知识资源将不再以公开、可获取的形式留给未来世代。