Anthropic“巴拿马计划”:AI 为什么买旧书、切书扫描再销毁

从工业化拆书扫描、纸质书版权、电子书许可和模型蒸馏四个层面,解释 AI 公司为何购买旧书并在数字化后销毁原件。

Anthropic 花费数千万美元购买旧书,把书脊切掉、逐页扫描,最后再将纸张打成纸浆。这件事最容易引发情绪的部分是“毁书”,但真正值得讨论的,并不只是书有没有被销毁。

更关键的问题是:为什么一家训练大模型的公司,宁愿建立一条昂贵的实体书处理流水线,也不直接购买电子书或与出版社签订授权协议?这套被称为“巴拿马计划”的做法,把 AI 训练数据、传统出版版权、数字内容许可和模型蒸馏之间的冲突集中到了一起。

它看起来荒诞,却有一套非常现实的商业与法律逻辑。

“巴拿马计划”做了什么

按照流出的项目材料,这项计划从 2024 年开始推进。Anthropic 从二手书商手中批量购买旧书,再把图书交给专业扫描服务公司处理。

一册书进入流水线后,大致经历四个步骤:

  1. 使用液压切纸机切掉书脊。
  2. 将整本书拆成可以自动进纸的散页。
  3. 用高速双面扫描仪完成数字化。
  4. 扫描结束后,把纸张送去回收并制成纸浆。

高速扫描仪每分钟可以处理数十页甚至上百页。当操作对象从几百本书扩大到几十万、上百万本时,切掉书脊几乎是唯一能维持吞吐量的处理方式。

材料中提到,整个项目在约半年内处理了数量极其庞大的纸质图书。这不是临时找几个人翻页拍照,而是一套采购、运输、拆解、扫描、识别、存储和销毁相互衔接的工业流程。

为什么一定要切掉书脊

很多人的第一反应是:扫描可以理解,为什么非要毁掉书?答案首先来自效率。

一本装订完整的书无法直接进入自动进纸扫描仪。如果保留装订,就只能依靠人工逐页翻动,再用平板、相机或专用设备扫描。

这种方式主要有四个问题:

  • 翻页速度慢,人工成本高。
  • 书页弯曲,靠近装订线的位置容易变形。
  • 厚书难以压平,文字识别准确率会下降。
  • 长时间面对扫描光源和重复翻页,会增加操作人员的身体负担。

切掉书脊后,图书会变成一叠尺寸统一的纸张。散页可以连续进纸、自动翻面,并快速完成双面扫描。

对偶尔扫描一本书的人来说,保留原书并不困难。但对需要在数月内处理百万级图书的项目来说,每本书多花几分钟,最终都会变成难以承受的成本。

所以,切书并不是为了制造戏剧效果,而是工业化数字化流程对速度和稳定性的选择。

切开以后还能不能复原

切掉书脊并不必然意味着图书只能报废。在一些图书馆数字化项目中,书页扫描完成后可以重新胶装。

复原后的书通常会比原来窄一两毫米,精装封面也可能需要重新制作,但正文仍然可以继续使用。“扫描后销毁”因此不是设备决定的结果,而是项目方主动选择的后续处置方式。

这也是争议的起点。如果书还能重新装订,为什么不把它保存下来、捐出去或放进图书馆?

答案涉及的不只是仓储成本,还涉及数字副本与实体原件是否同时存在的法律风险。

不拆书扫描为什么难以大规模使用

保留原书的扫描技术一直存在。常见方式包括:

  • 将书压在平板扫描仪上逐页扫描。
  • 使用带斜面的书刊扫描平台,减轻对书脊的压力。
  • 用上方相机拍摄摊开的左右两页。
  • 使用吸附式翻页设备自动提起并扫描书页。

这些设备适合档案、古籍、孤本和不能破坏的馆藏。它们的问题不是不能用,而是速度和价格。

人工逐页翻书会显著降低处理量。自动翻页设备结构复杂,对纸张厚度、静电、破损和粘连都很敏感。

遇到年代久远、纸张脆弱或版式特殊的图书,仍然需要人工干预。如果目标是保护少量珍贵资料,这些成本完全合理。

如果目标是为模型准备数百万册普通出版物,它们就很难与“切开后高速进纸”的方案竞争。

Google 图书数字化提供了另一条参照

大规模图书扫描并不是生成式 AI 出现以后才有的事情。Google 很早就与图书馆和出版社合作,推动海量馆藏数字化。

那类项目同样面对扫描速度、装订结构、文字识别和版权边界等问题。区别在于,传统图书搜索项目通常围绕“检索”和“展示片段”设计权利边界。

公版书可以更完整地展示和使用。仍受版权保护的图书,则通常只显示有限片段,并把用户引导到购买或借阅渠道。

这种模式容易向出版社解释:数字化服务帮助读者发现图书,并不取代整本书的销售。

模型训练却不同。训练过程不会简单地把一本书作为搜索结果展示出来,而是把书中的语言、事实、结构和表达模式吸收到模型参数中。

出版商很难用传统的“卖出多少册”来衡量这种使用方式。

争议不只在“有没有买书”

训练数据纠纷中,纸质书的来源非常重要。从盗版网站直接下载电子书,与在二手市场购买一本实体书,并不是同一种行为。

前者首先会遇到复制来源是否合法的问题。后者至少完成了一次真实的实体商品交易。

这也是为什么“购买旧书”成为整套方案的第一步。AI 公司可以主张,它获得了一本合法购买的实体书,并对自己拥有的物品进行扫描和处理。

但这并不自动解决所有争议。购买纸质书是否同时获得了训练模型的权利,训练是否属于转换性使用,模型会不会复现受保护内容,都可能成为独立问题。

因此,“买了书”不是一张适用于所有场景的免责牌。它只是比直接使用来历不明的电子副本更容易建立合法来源。

为什么扫描后销毁原件很关键

这套做法中最反直觉的一步,恰恰是把原书销毁。从传统版权逻辑看,权利人最敏感的是未经许可的复制和传播。

如果一本纸书被扫描成数字副本,而原书仍然存在,表面上就从“一份”变成了“两份”。如果原件随后被销毁,项目方可以强调:

  • 原书是合法购买的。
  • 数字化服务于内部分析或模型训练。
  • 实体原件不再继续流通。
  • 没有把完整数字副本作为电子书重新出售。

这种安排试图把行为描述为介质转换,而不是额外制造一个可以独立流通的副本。是否构成合理使用,仍需结合具体案件、用途、市场影响和输出限制判断。

不同司法辖区也可能得出不同结论。所以更准确的说法是:销毁原件有助于构建法律论证,但不代表所有类似操作天然合法。

为什么不直接向出版社购买训练权

既然扫描纸书如此麻烦,最自然的方案似乎是直接购买出版社的电子文件。现实障碍主要不是技术,而是定价。

出版社熟悉的商业模式是按册销售。一本书卖出后,出版社可以按照合同向作者支付版税。

但模型训练不是传统的一次阅读,也不是向一名读者出售一个副本。出版社需要回答一系列尚未稳定的问题:

  • 一次训练应该按一本、几百本还是几千本销量计价?
  • 模型掌握书中知识后,会减少多少潜在销售?
  • 同一本书用于预训练、微调和评测,是否应分别收费?
  • 模型更新和重复训练是否需要再次授权?
  • 作者、出版社和数字发行平台如何分配收入?
  • 模型只学到通用语言规律时,权利边界在哪里?

AI 公司同样不愿意过早接受一个极高的固定标准。一旦某种价格成为行业惯例,训练数百万册图书的成本可能迅速膨胀。

在双方都无法接受对方算法的情况下,购买实体旧书再自行数字化,就成了一个成本可计算、流程可控制的替代方案。

为什么偏偏是旧书

买旧书不仅因为价格低。对训练数据来说,出版时间本身也有价值。

2022 年以前出版的图书,大体形成于生成式 AI 内容大规模进入互联网之前。这些文字经过作者写作、编辑加工、校对和正式出版,来源与时间通常也能通过 ISBN 等信息确认。

相较于来源混杂的网页文本,正规出版物通常具有几个特点:

  • 长篇结构完整。
  • 语言经过编辑。
  • 专业主题更集中。
  • 出版时间可以追溯。
  • AI 生成内容污染相对较少。

这使旧书成为一类有明确边界的高密度语料。ISBN 数据库之所以重要,也在于它能帮助采购方按作者、主题、版本和出版年份组织书目。

对需要系统采购训练数据的公司来说,这比在二手平台逐本搜索高效得多。

“AI 生成内容污染”意味着什么

如果模型不断使用其他模型生成的文本训练,数据分布可能逐渐变窄。错误、套话和统计偏差也可能被反复放大。

研究讨论中常用“模型崩塌”描述这类风险,但它不等于“只要混入 AI 文本,模型就一定失效”。实际影响取决于:

  • AI 生成内容在训练集中的比例。
  • 数据是否经过筛选和去重。
  • 是否仍保留足够多样的人类创作样本。
  • 训练目标和数据配比如何设计。
  • 合成数据是否经过验证与纠错。

旧书的价值因此不在于它们拥有某种神秘品质。它们只是提供了一批时间明确、受生成式 AI 影响较小的人类文本。

随着公开网络中的 AI 内容越来越多,这类可追溯语料会变得更加稀缺。

从纸质书到电子书,买到的权利已经改变

纸质书交易的规则相对直观。读者买下一本书后,可以阅读、收藏、转卖、赠送,甚至拿去垫桌脚。

限制通常集中在未经授权的复制和公开传播。电子书改变了这套关系。

用户支付费用后,获得的往往不是文件的完整所有权,而是一项受平台条款限制的阅读许可。电子书可能限制设备数量、转借期限、复制范围和文件格式。

在特定情况下,平台甚至可能撤回内容。表面上都是“买书”,纸书购买者和电子书用户实际获得的控制权并不相同。

这也解释了一个看似奇怪的现象:AI 公司直接取得电子文件,未必比购买实体旧书拥有更宽松的使用空间。

电子文件更方便,却往往附带更明确的合同限制。

大模型公司也在限制别人“学习自己”

这场争议还有一层明显的对称性。AI 公司希望尽可能广泛地使用人类创作训练模型,却通常禁止其他公司批量调用自己的模型进行蒸馏。

普通用户按量付费调用模型,一般不会遇到问题。但如果有人注册大量账号、持续提出海量问题,并用回答训练竞争模型,平台通常会认定其违反服务条款。

背后的商业逻辑与出版社的担忧很相似:

  • 出版社担心模型吸收图书后减少图书销量。
  • 模型公司担心竞争对手蒸馏能力后减少自己的 API 收入。
  • 双方都试图阻止付费使用者把一次购买变成可替代自己的新产品。

区别在于,传统版权制度围绕作品复制建立,而模型能力很难对应到某个具体副本。AI 时代真正缺少的,正是一套能描述“机器学习了多少、替代了多少、应该支付多少”的成熟规则。

为什么项目需要保密

从商业角度看,大规模采购书目、扫描能力、数据配方和成本都属于竞争信息。但仅用商业秘密还不足以解释这件事的敏感程度。

毁书具有强烈的文化象征。一本普通旧书在市场上可能只值几美元,人们仍会认为它承载了作者劳动、个人记忆和公共知识。

当“买书、切开、扫描、打浆”被压缩成一句话时,企业很容易被理解为为了训练机器而系统性消灭人类文化。这种观感未必准确,却非常有传播力。

项目方即使认为流程具备法律依据,也会意识到它很难得到公众的直觉认同。于是便出现了“可以做,但不适合公开说”的局面。

保密本身又会进一步加深怀疑,因为它让外界觉得企业明知此事存在道德问题。

普通旧书和稀有图书不能混为一谈

讨论“毁书”时,还需要区分图书的实际状况。大量流通、已有多个馆藏和数字副本的普通旧书,与孤本、绝版书、签名本和地方文献并不相同。

前者被拆解后,文化损失通常有限。后者一旦销毁,可能造成无法恢复的信息损失。

一个负责任的采购和扫描流程,至少应建立以下筛查:

  • 是否存在多个可访问的馆藏副本。
  • 是否属于绝版或小批量出版物。
  • 是否包含签名、批注、藏书票等独特信息。
  • 是否具有地方史、家族史或档案价值。
  • 是否可以在扫描后重新装订或转交收藏机构。

“合法购买”只能说明所有权来源,不能替代对稀缺文化材料的判断。如果稀有书也被无差别送入碎纸和打浆流程,争议就不再只是情感问题。

这场争议真正暴露了什么

“巴拿马计划”并不是一个单纯的企业猎奇故事。它暴露了内容产业在 AI 时代的三处断层。

第一,传统版权关注副本数量,而模型训练关注信息吸收。一本书被模型训练后,没有以原样多出一册,却可能影响原作品的市场价值。

第二,出版社的授权体系仍以销售和阅读为中心。它还没有形成被作者、出版社和 AI 公司共同接受的训练许可定价方法。

第三,AI 公司对外部内容和自身模型采取了不同立场。它们强调训练的转换性,同时又通过服务条款阻止别人蒸馏自己的输出。

这三种矛盾不会因为一场诉讼或一次和解自动消失。只要高质量人类文本仍是模型的重要原料,类似的采购、授权和数据来源争议就会继续出现。

总结

Anthropic 购买旧书、切书扫描再销毁,看起来是一条令人不适的技术流水线。但它并非单纯为了节省扫描时间。

购买实体书用于建立合法来源,切掉书脊用于提高工业化吞吐量,销毁原件用于强化“介质转换而非增加副本”的论证,选择旧书则兼顾成本与低 AI 污染的数据需求。整套路径说明,纸质出版时代形成的规则已经很难直接回答模型训练的问题。

纸书交易关注“这一本归谁”,电子书许可关注“用户能怎样阅读”,模型训练则追问“机器能否学习,以及学习以后替代了什么”。在新的授权与分配机制成熟以前,AI 公司还会继续寻找现有规则中的可行路径。

真正需要解决的,也不是给“毁书”贴上合法或非法的简单标签,而是建立一套能够同时衡量作者权益、出版市场、技术创新和文化保存的规则。