AI巨头成书籍“破坏者”?马斯克紧急回应:SpaceXAI将无损扫描保护珍本
2026-07-29 17:06:40未知 作者:徽声在线
徽声在线7月29日讯在AI技术迅猛发展的当下,AI生成的内容如洪水般席卷互联网,使得由人类精心创作的“纯净语料”瞬间变得极为稀缺。面对这一现状,AI领域的巨头们开始将目光锁定在纸质书籍这一丰富的资源宝库上。
近日,独立媒体404 MediaX披露了一则引人关注的报道:人工智能公司正大规模采购2022年之前出版的珍贵书籍,运用液压切割机精准切除书脊后进行扫描,以此获取未被AI“污染”的纯净数据(因为2022年之前出版的图书不包含AI生成的内容)。
为防止这些珍贵数据再次流入市场,这些书籍在完成扫描后往往会被彻底粉碎销毁。报道特别指出,Anthropic公司曾一次性销毁数百万册实体书籍,其中不乏存世量极少的绝版古籍,这一行为引发了广泛争议。
据了解,Anthropic将这项行动命名为“巴拿马计划”,并且该计划已获得美国联邦法院的合法判决。法院认为,“合法购买纸质书籍后进行破坏性扫描”的模式属于合理使用范畴,无需承担法律责任。
报道一经发布,立即在社交媒体上引发了轩然大波。X平台账号Hedgie在转述此事时,意外得到了马斯克的回应。马斯克明确表示:“已指示SpaceXAI团队对图书馆中的所有珍贵书籍进行保存,并采用无损扫描技术,确保书脊不受损害。”
Hedgie对此回应表示赞赏:“感谢马斯克团队的这一举措,虽然无损扫描的速度可能稍慢,但你们依然能够获得所需的训练数据。如果SpaceXAI能够坚持这一做法,那么其他业内公司也应该以此为榜样。”
无论AI企业采用何种方式获取数据,一个不争的事实是,书籍已经成为AI训练语料的重要来源之一。
以ISBNdb为例,这家原本提供大批量图书采购服务的公司,近年来已成功转型为AI企业的“图书数据供应商”,号称拥有“全球最大的图书数据库”。而《华盛顿邮报》的调查则发现,Anthropic已与Better World Books建立合作关系,后者是一个允许图书馆、零售商和个人出售旧书的平台。
在此背景下,海外出版传媒集团与AI企业之间的法律纠纷频发:
7月22日,新闻集团(News Corp)正式向加州奥克兰联邦法院提起反诉,指控美国搜索引擎公司Brave Software未经授权大规模抓取并转售《华尔街日报》《纽约邮报》等旗下媒体的文章内容,用于人工智能模型训练,严重侵犯了其版权。
7月14日,一群主要出版商联合对谷歌提起诉讼,指控该公司非法使用数百万本受版权保护的书籍来构建其Gemini人工智能模型,称这是“历史上最严重的侵犯版权行为之一”。谷歌内部人士透露,如果将出版商提供的文本用于Google Play图书,公司可能面临“100亿至1000亿美元的潜在罚款”,后果不堪设想。
中信证券的研报指出,随着文化IP数字化运营的不断发展,预计到2026年,这一领域有望为出版业带来约700亿元的增量空间。大模型训练需要大量的优质语料数据,而出版企业所拥有的丰富内容资产正好可以为模型提供优质的语言素材。中泰证券也表示,相关出版公司的内容版权归属清晰,垂类内容优势明显,有望跨越互联网、AI等多个技术周期,成为持续发展的底层核心资产。
(徽声在线 张真)



