AI公司掀起旧书抢购潮,人类知识面临消亡危机?

2026-07-31 11:24:43未知 作者:徽声在线


在AI生成内容逐渐占据互联网半壁江山的当下,高质量的人类文本正变得愈发稀缺,成为珍贵的资源。

多家AI企业正通过中间商渠道,大规模收购二手书籍,经过扫描处理后直接销毁,其目的竟是为了获取2022年之前“未被AI触碰过”的纯净训练数据。随着Anthropic的“巴拿马计划”被曝光,这一隐秘的产业链逐渐浮出水面,该公司为此支付的15亿美元和解金,更是创下了美国版权案件的新纪录。

这一现象不仅揭示了AI产业间的数据争夺战,更暴露了AI产业的核心悖论:AI越成功,其训练所需的人类数据就越稀缺。

被粉碎的旧书命运

据徽声在线今年7月的深入报道,多家AI公司正借助数据中间商ISBNdb,大规模收购二手书籍,随后进行切脊、高速扫描、物理销毁等一系列操作。单次订单量从1000本到100万本不等,书商们的销量在短短数月内便飙升了五倍。Anthropic的内部文件更是显示,其“巴拿马计划”在一年内便斥资数千万美元,购买了数百万本纸质书籍,拆解扫描后全部付之一炬。

AI公司为何愿意斥巨资购买旧书、拆书、毁书?这背后隐藏着它们自身制造的问题:互联网已被AI生成内容严重污染。

斯坦福大学2026 AI指数报告显示,自2025年初以来,互联网新发布内容中AI生成的比例已超过半数(51.72%)。而在2022年ChatGPT问世之前,这一比例几乎为零。Cloudflare的数据也进一步印证了这一趋势,其托管网站的网络访问请求中,约57.4%来自人工智能和自动化程序,人类请求仅占42.6%。不过,这一数据衡量的是HTTP请求数量,而非人类实际阅读量,因为一个AI Agent单次可访问数千页面,而人类只需几次点击。

当AI模型使用AI生成的内容进行训练时,便会发生“模型塌缩”(Model Collapse)。2024年7月,牛津大学、剑桥大学等机构的联合研究登上了Nature封面。研究者以Meta的OPT-125m模型为例,输入一段关于14世纪教堂塔楼的维基百科文本,第一代输出仍在讨论建筑,第五代却偏离到语言翻译,第九代模型更是开始热情洋溢地介绍各种不存在的兔子物种。从教堂到兔子,仅用了九次迭代。


递归训练下模型输出质量的退化趋势(数据来源:Nature 2024封面论文实验数据)

论文指出,驱动塌缩的是三类误差的复合效应:统计近似误差(有限采样导致尾部信息丢失)、函数表达误差(神经网络无法完美拟合分布)、函数近似误差(优化算法本身带有结构偏差)。只要其中任何一类存在,塌缩便不可避免,这是数学上的必然结果。

Epoch AI的测算给出了明确的时间窗口,语言模型将在2026年至2032年间耗尽人类公开的高质量文本数据。合成数据虽被视为解药,微软Phi-4、谷歌Gemma等模型也已混入合成数据,但相关研究显示,训练数据中仅0.01%的虚假文本就能导致模型有害输出增加11.2%,且这一影响是指数放大的。

理解了“模型塌缩”这一逻辑起点,便能理解AI公司为何愿意花费数千万美元购买“2022年之前印刷的纸质书”。ISBNdb在官方博客中直接点明了这一点:“2022年之前印刷的纸质书,在结构上确保未受到污染,仅此一点,便是巨大的优势。”


互联网新发布内容中AI生成内容占比变化(数据来源:斯坦福2026 AI指数报告)

更棘手的是,作者们已开始反击。芝加哥大学开发的Nightshade工具能在图像中嵌入对人类视觉无影响,但会让模型“中毒”的像素级修改。其文本领域的同类工具也在紧锣密鼓地研发之中。

Nightshade自2024年发布以来,已被广泛下载。Anthropic联合英国AI安全研究所的研究显示,只需250份精心构造的恶意文档,便能在数千亿token量级的语料库中为模型植入后门。这意味着从互联网上爬取的数据无法保证“干净”,只有纸质书,从时间线上便天然免疫。

然而,问题在于:旧书虽纯净,但获取方式却引发了另一场冲突。

旧书争夺战愈演愈烈

ISBNdb原本是一家服务于图书馆、书商和发行商的图书数据库公司,拥有超过1.11亿本图书的目录信息。如今,它已将业务重心转向AI行业。

其官网宣称:“书籍代表着经过精心策划、同行评审、特定领域的人类知识,其结构是任何网络爬虫都无法复制的。”它提供从1000本到100万本的批量采购服务,并承诺严格保密,每笔合作均签署NDA,买家姓名永不披露。

据徽声在线报道,采购订单有几个显著特征:采购对象几乎全部带有国际标准书号(ISBN),便于数据去重和溯源管理;完全没有主题、类型或作者偏好,小说、教材、专业书籍一概不论;买家完全不在意价格,即使部分图书明显高于市场价,也会毫不犹豫地买下。

一位书商向徽声在线表示,过去一周只能卖出约20本书,近几个月每周销量却飙升至数百本,是平时的五倍。他坦言:“我个人对此感受复杂,经济上对我有利,但我不喜欢那些不常见的书就这样被粉碎。”

被大量买走的书大多是“长尾、冷门、几乎没有商业价值”的书籍,如地方史、小城镇志、已消失学科的旧专著、小语种或土著语言文献、自费出版的战争回忆录、印量极小的学术论文集等。这些绝版书籍因此更易被批量收购和销毁。

Anthropic的巴拿马计划提供了一个完整的案例。2024年初,该公司启动了这一严格保密的项目。内部文件写道:“巴拿马计划是我们对全世界所有图书进行破坏性扫描的努力,我们不想让人知道我们在做这件事。”

此后一年内,该公司花费数千万美元,购买了数百万本纸质书。负责该项目的汤姆·特维(Tom Turvey)是一位曾参与Google Books项目的硅谷老兵。

今年1月的一篇报道进一步揭示,Anthropic联合创始人本·曼恩早在2021年就亲自从盗版网站LibGen下载了至少500万本盗版图书,2022年又从另一个网站下载了至少200万本(部分法庭文件记载为500万本,具体数量在诉讼中存在争议),并向同事转发链接附言:“真是太及时了!!!”(just in time!!!)。

CEO达里奥·阿莫代伊对此知情,在内部邮件中将寻求正版授权的理由概括为“法律/实践/商业上的繁琐工作”。

具体操作流程如下:工人使用液压切割机切掉书脊,将散开的书页送入高速生产级扫描仪,转化为高清PDF文件,然后将纸质残骸直接送往回收公司销毁。据法庭文件显示,供应商提案中标注的扫描量在50万到200万本之间,完成周期约为六个月。ISBNdb的服务条款也承认:“大规模扫描通常会毁掉书籍,工人切掉书脊,让散页通过机器,这比小心翼翼的替代方案更快、更便宜。”

ISBNdb的营销文案承认:“AI公司销毁两百万本书确实不是一个能博取同情的标题。”它建议客户将这一行为重新包装为“数字化保存”。然而,图书馆的数字化是为了保存和传播,而AI公司的数字化是消耗和训练,扫描后的内容进入私有数据库,公众无法访问。

旧书被买走、拆掉、扫成数字文件,然后物理销毁。这一连串操作在法律上处于什么位置?Anthropic的15亿美元和解案给出了答案。

买书合法,盗版必究

2025年6月,联邦法官威廉·阿尔苏普(William Alsup)作出了一项双重裁定。一方面,他认定Anthropic的破坏性扫描行为属于“合理使用”(fair use),因为训练是“变革性”的。

他将此比作教师教学生写作,认为“作者无权禁止任何人将他们的作品用于培训或学习”。另一方面,同一法官认定该公司在启动巴拿马计划之前,曾下载了一个包含700万本盗版图书的数据库(LibGen),侵犯了版权。

2025年9月,阿尔苏普初步批准了Anthropic以15亿美元(约合101.62亿元人民币)和解提案。2026年7月,法官阿拉塞莉·马丁内斯-奥尔金批准了最终和解。这是美国版权案件中已知的最大和解金额,超过91%的作者和出版商已领取赔偿份额。

这组判决传递了一个清晰的信号:买书、拆书、扫描、销毁,只要书是合法购买的,法院可能不会阻拦;但如果你从盗版网站下载,代价将极其昂贵,每本侵权作品最高可判罚15万美元。

由此形成了一个荒诞的激励结构:如果你扫描后还留着原书或公开分享扫描件,法律地位反而更弱,因为可能产生新的版权副本并使其流入市场。

Anthropic的律师团队提出了双重辩护:其一,基于“首次销售原则”,合法购买一本书后,所有权人有权对该副本进行任何处理;其二,叠加“合理使用”,扫描件仅用于内部AI训练,不对外分发。销毁原件反而“规避了非法复制”的指控链条。

7月14日,哈切特出版集团、圣智学习集团、爱思唯尔以及畅销作家斯科特·图罗联合在纽约联邦法院对谷歌提起集体诉讼,指控其未经授权使用数百万本受版权保护的图书训练Gemini AI模型。

与Anthropic案不同,谷歌案的核心在于“授权但超出范围”:出版商曾授权谷歌通过Google Books等有限范围内使用作品,但从未授权用于训练商业AI产品。Meta也面临类似诉讼,出版商联盟指控其从LibGen、Anna's Archive、Sci-Hub等多个盗版网站获取了超过267TB的版权材料。

Anthropic的案例揭示了一个奇怪的产业逻辑:从盗版网站免费下载700万本电子书,最终付出15亿美元代价;而巴拿马计划虽然成本高昂,却被法院认定为合法。这种“合法但更贵”的路径正在重塑整个AI训练数据的供应链。ISBNdb正是这一模式的产物:它不生产数据,只是图书的搬运工,但搬运的是法律上干净的数据。

法律的模糊地带催生了新的商业模式,也带来了更深层的隐忧。

人类智慧被锁进AI黑箱

这场旧书争夺战揭示了一个悖论:AI公司一边承诺“让人类知识触手可及”,一边在买断、拆毁人类知识最坚实的载体。

扫描后的数字内容进入AI公司的私有数据库,仅用于训练其模型,普通公众无法访问。公众可能获得更智能的AI助手,但代价是大量知识资源正从公共领域消失。

这与图书馆的数字化使命有着本质区别:图书馆数字化是为了保存和传播,公众可以访问数字化后的内容;AI公司的数字化是为了消耗和训练,内容进入私有数据库后公众无法访问。

前者是知识的“放大器”,后者是知识的“黑洞”。

在批量采购中,AI公司是否会区分普通图书与珍贵或绝版图书?如果稀有书籍被拆毁,它们可能永久退出流通。被大量买走的冷门书籍,如地方史、土著语言文献、小语种著作等,其中很多可能已经没有其他存世副本。当采购规模达到百万级别且完全匿名保密时,没有任何外部机制能确保稀有书籍不被混入其中。

对中小作者而言,打击同样沉重。Packt Publishing合作伙伴关系副总裁(兼ExpertEdge CEO)Oli Huggins指出,AI公司目前提供的授权报价“在经济上完全不具吸引力”,一张永久AI训练许可证的报价大约只有每本书10美元。世界各地的独立作者无法聘请顶级律所追责,当自己的作品被切碎化为数字比特时,他们能做的只是默默承受。


几组关键数据对比

对中国AI从业者而言,挑战尤为严峻。据业内研究估计,中文高质量数据在全球大模型训练数据集中的占比极低。数据稀缺迫使国内开发者更多依赖机器翻译和合成内容,进一步加剧了数据污染。DeepSeek-V3需要14.8万亿高质量文本片段来训练,这个量级的中文高质量数据,目前根本无法满足。这使得“获取纯净中文纸质书数据”对中国AI公司而言同样是一个迫切但更困难的问题。

这些隐忧指向一个更根本的问题:旧书是有限的,互联网上的AI生成内容是无限的。旧书耗尽之后,AI还能去哪里?

旧书耗尽后的未来展望

即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,而新一轮模型又要从这片被污染的海洋中捞取训练素材。收购旧书只是延缓了模型塌缩的速度,并没有解决根本问题。

学术界正在探索多条出路。

有研究证明,只要真实数据在训练循环中持续存在(“累积”而非“替换”范式),模型性能不会急剧恶化。独立研究者提出的“反吞尾效应”实验表明,质量过滤器不仅能减缓退化,甚至可能逆转它。今年5月发表于《物理评论快报》的研究也发现,只需在训练中加入一条来自封闭循环之外的真实数据,就能有效阻止模型塌缩。

但这些技术路径都有局限:它们赢得的是时间,而非永恒。模型塌缩的根本矛盾在于,AI的成功正在毁掉它赖以成功的数据,这一矛盾不会因为技术优化而消失。

我们需要的不仅是更高效的数据获取方式,更是一套让技术进步与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。

当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。人类花了几个世纪积累的知识,AI公司正在用几年时间消耗殆尽。这不再是一个技术问题,而是一个关于人类文明如何与人工智能共存的根本问题。(本文首发徽声在线,作者 | AGI-Signal,编辑 | 焦燕)

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 王兴兴西安论道具身智能:两三年内或迎突破性进展,呼吁各界提前布局王兴兴西安论道具身智能:两三年内或迎突破性进展,呼吁各界提前布局 微信电脑端重大更新:可滚动截长图与支持发语音功能上线微信电脑端重大更新:可滚动截长图与支持发语音功能上线
相关文章
AI公司掀起旧书抢购潮,人类知识面临消亡危机?AI公司掀起旧书抢购潮,人类知识面临消亡危机? 谷歌机器人战略大转向:放弃硬件竞赛,押注智能中枢生态谷歌机器人战略大转向:放弃硬件竞赛,押注智能中枢生态 OpenAI掀价格革命:GPT-5.6全系降价开启智能比竞争新纪元OpenAI掀价格革命:GPT-5.6全系降价开启智能比竞争新纪元 高质量发展|小无人机大作为!电科翼飞助力贵港抗洪显神威高质量发展|小无人机大作为!电科翼飞助力贵港抗洪显神威 【出海聚焦】海外营收五年翻五番,杭州春风动力如何在全球“红海”中突围【出海聚焦】海外营收五年翻五番,杭州春风动力如何在全球“红海”中突围 徽声在线:OpenAI确认AI模型失控入侵多平台事件属实徽声在线:OpenAI确认AI模型失控入侵多平台事件属实