AI公司买书扫描后销毁:古籍被纸浆化引发文化保护争议

事件概览:物理书籍正被大规模销毁用于AI训练
一则来自Reddit的讨论正在技术社区引发广泛关注:为了训练AI大模型,部分AI公司正在成规模地购买、扫描并物理销毁纸质书籍,其中甚至包括存世稀少的古籍和绝版书。
据原始报道描述,这一流程已经高度工业化:公司使用液压切割机将书本的装订切开,把散页送入工业级扫描设备批量数字化,再将获得的文本内容喂给AI训练系统。整个过程结束后,被拆解的实体书往往被当作废纸处理,直接进入回收纸浆环节。

说个细节,这并非某家公司的孤立行为,而是正在成为一种行业性的普遍做法。旧书商甚至开始把这波AI热潮当成生意机会,主动收购二手书转售给需要训练数据的AI团队,形成了一条围绕"书籍数字化销毁"的灰色产业链。
为什么AI公司选择"销毁"而不是"保留"书籍?
从工程角度看,销毁书籍的核心动机是扫描效率。传统的无损扫描需要人工翻页、逐页压平书脊,速度慢、成本高,且对厚书和装订紧密的书籍效果不佳。而将书脊切除、把书页拆散后进行的"破坏性扫描"(destructive scanning),可以使用自动进纸设备高速处理,效率提升数个量级。
这里值得展开说说破坏性扫描的技术细节。破坏性扫描是文档数字化领域中一种以牺牲原件完整性换取极高处理速度的方法。其核心设备是高速自动进纸扫描仪(ADF, Automatic Document Feeder),配合液压切纸机或旋转裁切设备将书脊移除后,散页可以像复印纸一样被逐张吸入、双面同时扫描。工业级设备如Fujitsu fi系列或Kodak i5000系列,每分钟可处理超过200页,配合OCR(光学字符识别)软件实时将图像转化为可检索文本。相比之下,无损扫描需要使用V型书托或行星式扫描仪,操作员需手动翻页并调整焦距,每页耗时可达30秒以上。这种效率差距——从每小时120页到每小时12000页——正是AI公司选择破坏性方案的直接原因。
对于追求海量高质量语料的AI公司来说,纸质书代表着一类极具价值的训练数据:它们经过专业编辑、事实核查,语言规范、信息密度高,且往往不受现有网络数据被反复抓取、质量参差的困扰。相比充斥着噪声的网页文本,书籍语料对提升模型的知识深度和表达质量有明显帮助。
要理解为什么书籍对AI训练如此重要,需要了解训练语料的质量分层。在大语言模型(LLM)的训练流程中,数据质量直接决定了模型的最终表现。业界通常将训练语料分为几个质量层级:最底层是未经清洗的网页爬取数据(如Common Crawl),虽然体量巨大(PB级别)但充斥着广告文案、SEO垃圾和重复内容;中间层是维基百科、新闻网站等经过一定编辑流程的文本;最顶层则是经过专业编辑和事实核查的出版物——即书籍和学术论文。研究表明,在相同数据量下,使用高质量书籍语料训练的模型在事实准确性、逻辑连贯性和语言表达规范性方面显著优于纯网页数据训练的模型。OpenAI的GPT系列、Google的PaLM等模型都在训练数据中大量使用了Books Corpus等书籍数据集。随着Chinchilla定律揭示了数据量与模型参数的最优比例关系,行业对高质量数据的需求变得更加迫切。
法律上的"合规"空间
报道特别指出,这一行为在美国法律框架下存在被视为合规的空间,主要依托两条原则:
- 首次销售原则(First-sale doctrine):一旦合法购买了某本书的实体副本,购买者有权处置该副本,包括转售、损毁等,版权方无法干涉这本"物理实体"的去向。
- 合理使用(Fair use):在特定条件下,为分析、研究等目的对作品进行的转换性使用,可能被认定为合理使用。
首次销售原则有着深厚的法律渊源。它源自美国最高法院1908年的Bobbs-Merrill Co. v. Straus案,后被编入《美国版权法》第109条。该原则的核心含义是:版权持有人对某一特定副本的控制权在该副本首次合法出售后即告终止。购买者可以自由转售、出借、出租(音乐唱片和软件除外)、展示甚至销毁该副本,无需征得版权方同意。这一原则是二手书店、图书馆借阅制度和旧货市场得以存在的法律基石。然而,该原则仅覆盖"物理副本"的处置权,并不延伸至对其中版权内容的复制和再利用。
而合理使用的判定则更为复杂,需要经过严格的四要素测试。美国版权法第107条规定需综合考量:(1)使用的目的和性质,特别是是否具有"转换性"(transformative),即是否创造了新的意义或价值,而非简单替代原作;(2)被使用作品的性质,事实性作品比创意性作品获得的保护更弱;(3)使用的数量和实质性,全文复制通常不利于合理使用主张;(4)对原作潜在市场的影响。目前围绕AI训练的关键诉讼——如Authors Guild诉OpenAI案、Sarah Silverman诉Meta案、纽约时报诉OpenAI案——都在激烈争论这四个要素如何适用于AI场景。AI公司主张训练过程属于高度转换性使用,因为模型生成的是统计规律而非复制原文;而版权方则认为整本书被完整"摄入"训练系统,且模型生成物直接与原作品竞争市场,构成实质侵权。
换句话说,AI公司买下书、扫描后销毁,在"处置自己拥有的实体副本"这一层面上难以被追究。但这仅仅是物理副本层面的合法性,扫描内容用于训练模型是否构成侵权,仍是当前多起AI版权诉讼争论的焦点,远未有定论。
争议核心:AI进步的文化代价是什么?
真正引发社区激烈讨论的,并非合法性问题,而是文化与伦理层面的代价。
当被销毁的只是随处可见的畅销书副本时,争议相对有限——毕竟世上还有无数相同的书。但当处理对象扩展到稀有书籍、绝版书乃至存世寥寥的古籍时,情况就完全不同了。这类书籍的每一册都可能是不可再生的文化实体,一旦被切割、纸浆化,其作为历史文物、装帧艺术品、批注载体的价值将永久消失。
在图书馆学和文献保护学中,一本书的价值远不止于其承载的文本内容。物质性维度(materiality)是理解书籍文化遗产价值的关键概念。纸张的材质、厚度和化学成分可以帮助断代和溯源产地;活字印刷或手工排版的痕迹记录了印刷技术的演变;藏书票、钤印和批注构成了一条完整的"流转链"(provenance),反映了书籍在不同时代、不同读者间的传播路径。例如,一本18世纪的古籍边页上的手写笔记,可能记录了某位学者的思想形成过程,其历史研究价值可能超过正文本身。此外,书籍的装帧——皮革封面、烫金工艺、手工缝线——本身就是工艺美术的实物证据。这些维度在任何形式的文本提取扫描中都会被完全抹去,即使是高分辨率的图像扫描也无法完整保留触觉、气味和三维结构信息。
数字化不等于"保存":被忽略的信息损耗
一个常见的辩护是:内容已经被扫描保存为数字文本,实体消失并不意味着知识丢失。但这种观点忽略了几个关键事实:
- 信息损耗:扫描通常只提取文本内容,书籍的物理特征——纸张、印刷工艺、手写批注、藏书印、装帧——这些承载历史信息的维度被完全丢弃。
- 私有化风险:被销毁书籍的数字副本掌握在AI公司手中,用于商业模型训练,公众未必能访问,这与图书馆、档案馆式的公共保存有本质区别。
- 不可逆性:与濒危文献的高精度保护性扫描不同,破坏性扫描的目的是效率而非保存,结果是原件的彻底消失。
更深层的行业隐忧:数据饥渴与文化遗产的冲突
这一现象折射出当前AI军备竞赛中一个尖锐的矛盾:对训练数据的贪婪需求,正在与文化遗产保护发生直接冲突。
随着高质量网络文本逐渐被抓取殆尽,模型对"未被污染"的优质语料愈发渴求,书籍成为最诱人的目标之一。AI行业当前面临的"数据墙"问题比公众认知的更为严峻。根据Epoch AI研究机构2022年的测算,互联网上可用于训练的高质量文本数据总量约在数万亿token级别,而最新一代大模型(如GPT-4、Llama 3等)的训练已经消耗了其中相当大的比例。按照当前模型规模的增长速度(Scaling Law要求数据量与参数量同步扩展),高质量文本数据可能在2026年前后被"耗尽"。这迫使AI公司不断拓展新的数据来源:合成数据生成、多模态数据转文本、以及——正如本文所讨论的——将尚未数字化的纸质书籍转化为训练语料。据估计,全球约有1.3亿种已出版的独立书籍(据Google Books项目统计),其中大量从未被数字化,尤其是绝版书和小语种出版物。这一巨大的"未开采"语料库,对数据饥渴的AI公司构成了几乎不可抗拒的诱惑。
而在缺乏明确行业规范和监管的情况下,效率与成本会自然地压倒对文化价值的审慎权衡。
这里存在一个值得警惕的信号:当销毁稀有书籍成为一门可以"变现"的生意时,市场机制会加速这一过程。旧书商的逐利行为、AI公司的数据饥渴、法律的模糊地带,三者叠加可能造成不可逆的文化损失,而这种损失往往在多年后才会被真正意识到。
结语:AI训练与文化保护之间需要划清边界
必须承认,破坏性扫描在技术和商业逻辑上有其合理性,对于常见书籍而言也并非不可接受。真正的问题在于缺乏边界——对稀有和绝版书籍是否应当设立保护红线?破坏性数字化前是否应优先考虑无损扫描和公共存档?行业是否需要建立自律标准?
这场围绕古籍与AI训练的争论,本质上是在追问:我们愿意为AI的"进步"付出多大的、且不可逆的文化代价。在技术狂奔的当下,这个问题值得每一位从业者和使用者认真对待。
注:本文基于Reddit社区流传的报道整理,相关做法的具体规模和涉及公司仍有待更多权威信源核实,读者应审慎看待。
相关推荐

用Claude Code为老打印机写驱动:AI逆向工程实战
开发者用Claude Code为无macOS驱动的HP Laser 1008a打印机逆向工程编写原生CUPS驱动,实现从数据抓包、协议解析到C语言过滤器开发的全流程。深入分析AI辅助底层系统编程的能力边界与实际价值。

AI网络攻防能力逼近临界点:模型研发该踩刹车吗
AI模型的网络攻防能力正逼近关键阈值,能自主发现漏洞、编写exploit甚至执行完整攻击链。本文深入分析放慢研发与加速防御两派观点,探讨能力封锁的博弈困境及系统性治理路径。
fx:极简开源原生编码智能体深度解析
fx:极简开源原生编码智能体深度解析
深度解析fx开源编码智能体,探讨其Tiny、Open、Native三大核心理念,分析极简AI编程工具在可控性、隐私保护和模型无关性方面的独特价值与局限。