AI公司掀起旧书抢购潮,人类知识面临消亡危机?
2026-07-31 11:24:43未知 作者:徽声在线
在AI生成内容逐渐占据互联网半壁江山的当下,高质量的人类文本正变得愈发稀缺,成为珍贵的资源。
多家AI企业正通过中间商渠道,大规模收购二手书籍,经过扫描处理后直接销毁,其目的竟是为了获取2022年之前“未被AI触碰过”的纯净训练数据。随着Anthropic的“巴拿马计划”被曝光,这一隐秘的产业链逐渐浮出水面,该公司为此支付的15亿美元和解金,更是创下了美国版权案件的新纪录。
这一现象不仅揭示了AI产业间的数据争夺战,更暴露了AI产业的核心悖论:AI越成功,其训练所需的人类数据就越稀缺。
被粉碎的旧书命运
据徽声在线今年7月的深入报道,多家AI公司正借助数据中间商ISBNdb,大规模收购二手书籍,随后进行切脊、高速扫描、物理销毁等一系列操作。单次订单量从1000本到100万本不等,书商们的销量在短短数月内便飙升了五倍。Anthropic的内部文件更是显示,其“巴拿马计划”在一年内便斥资数千万美元,购买了数百万本纸质书籍,拆解扫描后全部付之一炬。
AI公司为何愿意斥巨资购买旧书、拆书、毁书?这背后隐藏着它们自身制造的问题:互联网已被AI生成内容严重污染。
斯坦福大学2026 AI指数报告显示,自2025年初以来,互联网新发布内容中AI生成的比例已超过半数(51.72%)。而在2022年ChatGPT问世之前,这一比例几乎为零。Cloudflare的数据也进一步印证了这一趋势,其托管网站的网络访问请求中,约57.4%来自人工智能和自动化程序,人类请求仅占42.6%。不过,这一数据衡量的是HTTP请求数量,而非人类实际阅读量,因为一个AI Agent单次可访问数千页面,而人类只需几次点击。
当AI模型使用AI生成的内容进行训练时,便会发生“模型塌缩”(Model Collapse)。2024年7月,牛津大学、剑桥大学等机构的联合研究登上了Nature封面。研究者以Meta的OPT-125m模型为例,输入一段关于14世纪教堂塔楼的维基百科文本,第一代输出仍在讨论建筑,第五代却偏离到语言翻译,第九代模型更是开始热情洋溢地介绍各种不存在的兔子物种。从教堂到兔子,仅用了九次迭代。
递归训练下模型输出质量的退化趋势(数据来源:Nature 2024封面论文实验数据)
论文指出,驱动塌缩的是三类误差的复合效应:统计近似误差(有限采样导致尾部信息丢失)、函数表达误差(神经网络无法完美拟合分布)、函数近似误差(优化算法本身带有结构偏差)。只要其中任何一类存在,塌缩便不可避免,这是数学上的必然结果。
Epoch AI的测算给出了明确的时间窗口,语言模型将在2026年至2032年间耗尽人类公开的高质量文本数据。合成数据虽被视为解药,微软Phi-4、谷歌Gemma等模型也已混入合成数据,但相关研究显示,训练数据中仅0.01%的虚假文本就能导致模型有害输出增加11.2%,且这一影响是指数放大的。
理解了“模型塌缩”这一逻辑起点,便能理解AI公司为何愿意花费数千万美元购买“2022年之前印刷的纸质书”。ISBNdb在官方博客中直接点明了这一点:“2022年之前印刷的纸质书,在结构上确保未受到污染,仅此一点,便是巨大的优势。”
互联网新发布内容中AI生成内容占比变化(数据来源:斯坦福2026 AI指数报告)
更棘手的是,作者们已开始反击。芝加哥大学开发的Nightshade工具能在图像中嵌入对人类视觉无影响,但会让模型“中毒”的像素级修改。其文本领域的同类工具也在紧锣密鼓地研发之中。
Nightshade自2024年发布以来,已被广泛下载。Anthropic联合英国AI安全研究所的研究显示,只需250份精心构造的恶意文档,便能在数千亿token量级的语料库中为模型植入后门。这意味着从互联网上爬取的数据无法保证“干净”,只有纸质书,从时间线上便天然免疫。
然而,问题在于:旧书虽纯净,但获取方式却引发了另一场冲突。
旧书争夺战愈演愈烈
ISBNdb原本是一家服务于图书馆、书商和发行商的图书数据库公司,拥有超过1.11亿本图书的目录信息。如今,它已将业务重心转向AI行业。
其官网宣称:“书籍代表着经过精心策划、同行评审、特定领域的人类知识,其结构是任何网络爬虫都无法复制的。”它提供从1000本到100万本的批量采购服务,并承诺严格保密,每笔合作均签署NDA,买家姓名永不披露。
据徽声在线报道,采购订单有几个显著特征:采购对象几乎全部带有国际标准书号(ISBN),便于数据去重和溯源管理;完全没有主题、类型或作者偏好,小说、教材、专业书籍一概不论;买家完全不在意价格,即使部分图书明显高于市场价,也会毫不犹豫地买下。
一位书商向徽声在线表示,过去一周只能卖出约20本书,近几个月每周销量却飙升至数百本,是平时的五倍。他坦言:“我个人对此感受复杂,经济上对我有利,但我不喜欢那些不常见的书就这样被粉碎。”
被大量买走的书大多是“长尾、冷门、几乎没有商业价值”的书籍,如地方史、小城镇志、已消失学科的旧专著、小语种或土著语言文献、自费出版的战争回忆录、印量极小的学术论文集等。这些绝版书籍因此更易被批量收购和销毁。
Anthropic的巴拿马计划提供了一个完整的案例。2024年初,该公司启动了这一严格保密的项目。内部文件写道:“巴拿马计划是我们对全世界所有图书进行破坏性扫描的努力,我们不想让人知道我们在做这件事。”
此后一年内,该公司花费数千万美元,购买了数百万本纸质书。负责该项目的汤姆·特维(Tom Turvey)是一位曾参与Google Books项目的硅谷老兵。
今年1月的一篇报道进一步揭示,Anthropic联合创始人本·曼恩早在2021年就亲自从盗版网站LibGen下载了至少500万本盗版图书,2022年又从另一个网站下载了至少200万本(部分法庭文件记载为500万本,具体数量在诉讼中存在争议),并向同事转发链接附言:“真是太及时了!!!”(just in time!!!)。
CEO达里奥·阿莫代伊对此知情,在内部邮件中将寻求正版授权的理由概括为“法律/实践/商业上的繁琐工作”。
具体操作流程如下:工人使用液压切割机切掉书脊,将散开的书页送入高速生产级扫描仪,转化为高清PDF文件,然后将纸质残骸直接送往回收公司销毁。据法庭文件显示,供应商提案中标注的扫描量在50万到200万本之间,完成周期约为六个月。ISBNdb的服务条款也承认:“大规模扫描通常会毁掉书籍,工人切掉书脊,让散页通过机器,这比小心翼翼的替代方案更快、更便宜。”
ISBNdb的营销文案承认:“AI公司销毁两百万本书确实不是一个能博取同情的标题。”它建议客户将这一行为重新包装为“数字化保存”。然而,图书馆的数字化是为了保存和传播,而AI公司的数字化是消耗和训练,扫描后的内容进入私有数据库,公众无法访问。
旧书被买走、拆掉、扫成数字文件,然后物理销毁。这一连串操作在法律上处于什么位置?Anthropic的15亿美元和解案给出了答案。
买书合法,盗版必究
2025年6月,联邦法官威廉·阿尔苏普(William Alsup)作出了一项双重裁定。一方面,他认定Anthropic的破坏性扫描行为属于“合理使用”(fair use),因为训练是“变革性”的。
他将此比作教师教学生写作,认为“作者无权禁止任何人将他们的作品用于培训或学习”。另一方面,同一法官认定该公司在启动巴拿马计划之前,曾下载了一个包含700万本盗版图书的数据库(LibGen),侵犯了版权。
2025年9月,阿尔苏普初步批准了Anthropic以15亿美元(约合101.62亿元人民币)和解提案。2026年7月,法官阿拉塞莉·马丁内斯-奥尔金批准了最终和解。这是美国版权案件中已知的最大和解金额,超过91%的作者和出版商已领取赔偿份额。
这组判决传递了一个清晰的信号:买书、拆书、扫描、销毁,只要书是合法购买的,法院可能不会阻拦;但如果你从盗版网站下载,代价将极其昂贵,每本侵权作品最高可判罚15万美元。
由此形成了一个荒诞的激励结构:如果你扫描后还留着原书或公开分享扫描件,法律地位反而更弱,因为可能产生新的版权副本并使其流入市场。
Anthropic的律师团队提出了双重辩护:其一,基于“首次销售原则”,合法购买一本书后,所有权人有权对该副本进行任何处理;其二,叠加“合理使用”,扫描件仅用于内部AI训练,不对外分发。销毁原件反而“规避了非法复制”的指控链条。
7月14日,哈切特出版集团、圣智学习集团、爱思唯尔以及畅销作家斯科特·图罗联合在纽约联邦法院对谷歌提起集体诉讼,指控其未经授权使用数百万本受版权保护的图书训练Gemini AI模型。
与Anthropic案不同,谷歌案的核心在于“授权但超出范围”:出版商曾授权谷歌通过Google Books等有限范围内使用作品,但从未授权用于训练商业AI产品。Meta也面临类似诉讼,出版商联盟指控其从LibGen、Anna's Archive、Sci-Hub等多个盗版网站获取了超过267TB的版权材料。
Anthropic的案例揭示了一个奇怪的产业逻辑:从盗版网站免费下载700万本电子书,最终付出15亿美元代价;而巴拿马计划虽然成本高昂,却被法院认定为合法。这种“合法但更贵”的路径正在重塑整个AI训练数据的供应链。ISBNdb正是这一模式的产物:它不生产数据,只是图书的搬运工,但搬运的是法律上干净的数据。
法律的模糊地带催生了新的商业模式,也带来了更深层的隐忧。
人类智慧被锁进AI黑箱
这场旧书争夺战揭示了一个悖论:AI公司一边承诺“让人类知识触手可及”,一边在买断、拆毁人类知识最坚实的载体。
扫描后的数字内容进入AI公司的私有数据库,仅用于训练其模型,普通公众无法访问。公众可能获得更智能的AI助手,但代价是大量知识资源正从公共领域消失。
这与图书馆的数字化使命有着本质区别:图书馆数字化是为了保存和传播,公众可以访问数字化后的内容;AI公司的数字化是为了消耗和训练,内容进入私有数据库后公众无法访问。
前者是知识的“放大器”,后者是知识的“黑洞”。
在批量采购中,AI公司是否会区分普通图书与珍贵或绝版图书?如果稀有书籍被拆毁,它们可能永久退出流通。被大量买走的冷门书籍,如地方史、土著语言文献、小语种著作等,其中很多可能已经没有其他存世副本。当采购规模达到百万级别且完全匿名保密时,没有任何外部机制能确保稀有书籍不被混入其中。
对中小作者而言,打击同样沉重。Packt Publishing合作伙伴关系副总裁(兼ExpertEdge CEO)Oli Huggins指出,AI公司目前提供的授权报价“在经济上完全不具吸引力”,一张永久AI训练许可证的报价大约只有每本书10美元。世界各地的独立作者无法聘请顶级律所追责,当自己的作品被切碎化为数字比特时,他们能做的只是默默承受。
几组关键数据对比
对中国AI从业者而言,挑战尤为严峻。据业内研究估计,中文高质量数据在全球大模型训练数据集中的占比极低。数据稀缺迫使国内开发者更多依赖机器翻译和合成内容,进一步加剧了数据污染。DeepSeek-V3需要14.8万亿高质量文本片段来训练,这个量级的中文高质量数据,目前根本无法满足。这使得“获取纯净中文纸质书数据”对中国AI公司而言同样是一个迫切但更困难的问题。
这些隐忧指向一个更根本的问题:旧书是有限的,互联网上的AI生成内容是无限的。旧书耗尽之后,AI还能去哪里?
旧书耗尽后的未来展望
即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,而新一轮模型又要从这片被污染的海洋中捞取训练素材。收购旧书只是延缓了模型塌缩的速度,并没有解决根本问题。
学术界正在探索多条出路。
有研究证明,只要真实数据在训练循环中持续存在(“累积”而非“替换”范式),模型性能不会急剧恶化。独立研究者提出的“反吞尾效应”实验表明,质量过滤器不仅能减缓退化,甚至可能逆转它。今年5月发表于《物理评论快报》的研究也发现,只需在训练中加入一条来自封闭循环之外的真实数据,就能有效阻止模型塌缩。
但这些技术路径都有局限:它们赢得的是时间,而非永恒。模型塌缩的根本矛盾在于,AI的成功正在毁掉它赖以成功的数据,这一矛盾不会因为技术优化而消失。
我们需要的不仅是更高效的数据获取方式,更是一套让技术进步与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。
当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。人类花了几个世纪积累的知识,AI公司正在用几年时间消耗殆尽。这不再是一个技术问题,而是一个关于人类文明如何与人工智能共存的根本问题。(本文首发徽声在线,作者 | AGI-Signal,编辑 | 焦燕)

