AI公司数千万美元收购旧书并销毁原件,引发“知识枯竭”争议
2026/08/29 22:11阅读量 3
Anthropic等AI公司通过“巴拿马计划”花费数千万美元在全球收购大量冷门及绝版纸质书籍,经切书扫描后销毁实体原件以获取无AI污染的“有机数据”用于模型训练。尽管美国法院认定该行为符合“合理使用”原则且合法,但此举导致大量学术专著和地方志等公共知识资源不可逆流失。与此同时,创作者因担忧版权被滥用而采取加锁、水印等防御措施,导致互联网公开内容减少,人类知识获取正从开放共享转向巨头私有化壁垒。
事件概述
近期,包括Anthropic在内的多家AI公司被曝光启动名为“巴拿马计划”(Project Panama)的项目,通过商业渠道在全球二手市场大规模收购纸质书籍。这些书籍在亚马逊仓库等地经过液压切纸机破坏性处理后,仅保留数字副本用于AI大模型训练,实体书则被直接销毁。这一行为虽获美国法院基于“合理使用”原则的合法性认定,但因导致绝版书和冷门知识资源的永久消失,引发了关于“AI焚书”及公共知识枯竭的广泛争议。
核心信息
1. “巴拿马计划”运作模式与规模
- 采购策略:Anthropic于2024年初聘请前Google Books项目人员Tom Turvey负责寻书,投入数千万美元资金。买家不议价、不计运费,专门收购长期无人问津的冷门书、绝版书、小语种译本及专业手册。
- 处理流程:书籍运至亚马逊LAS8园区VGT3小组,员工使用高速扫描仪生成PDF和OCR文本,随后切掉书脊并将散页作为垃圾处理。据供应商估算,流水线半年可处理50万至200万本书。
- 数据用途:生成的数字副本一部分直接喂入大模型训练集,另一部分存入Anthropic的永久研究资料库。
2. 为何急需“纯有机数据”
- 对抗“模型坍塌”:互联网上充斥着由AI生成的低质量、重复性内容,导致模型在学习过程中出现理解扭曲(即“模型坍塌”)。2022年之前出版的书籍被视为未被ChatGPT污染的“纯天然数据”,具有更高的可信度。
- 稀缺的知识多样性:热门名著早已被数字化,AI真正缺乏的是包含冷门词汇、地方独特经验和小众专业知识的数据。旧书中的严谨结构和编辑审校内容,有助于改善模型的写作能力和事实准确性。
- 可追溯性优势:相比网页内容的多次转载和改写,出版物带有明确的作者、出版年份和版本记录,便于判断数据价值。
3. 法律认定与资源流失困境
- 司法判决:美国法院认为,Anthropic购买实体书后销毁原件,并未将纸质版和数字版同时二次流通,因此属于“合理使用”。
- 不可逆损失:许多学术专著、地方志和专业手册本身存世量极少。一旦作为“孤本”或最后副本被买走销毁,人类将永久失去阅读和查阅这些知识的途径。书商表示,若明知是世上最后一本,宁愿不卖也不愿其被毁。
- 技术选择:虽然图书馆和非破坏性扫描技术存在,但科技公司选择了速度更快、成本更低的破坏性扫描方式,未考虑书籍在二手市场的剩余存量。
4. 创作者防御与知识私有化趋势
- 和解与局限:2026年7月,美国法院批准Anthropic支付15亿美元与作者及出版商和解,但该赔偿仅针对从盗版网站获取的电子书,合法买书扫描的行为仍受法律保护。
- 防御措施升级:
- 出版界:企鹅兰登等出版社在新书版权页注明“严禁用于AI训练”;美国作家协会推出“Human Authored”认证标志。
- 网络创作者:画师使用Glaze干扰工具和Nightshade“毒药”工具防止图像被抓取;文字作者设置robots.txt协议,AO3等平台开启访问限速或锁文。
- 公共知识危机:创作者为防盗取作品而限制公开传播,导致互联网上的“活人内容”枯竭。与此同时,科技巨头通过私有数据库建立知识高墙,普通人获取高质量人类智慧的成本增加,且面临数据来源不透明、无法核实引用的问题。
值得关注
- 知识所有权的转移:传统纸书允许自由借阅、捐赠和流转,而AI训练后的知识被锁定在巨头服务器中,用户仅拥有临时调用权限,知识的公共属性正在减弱。
- 验证成本的上升:由于原始训练数据不公开,当AI提供错误信息时,普通用户难以回溯原文进行核实,导致“核实答案比寻找答案更难”。
