今天是2026年8月18日。我写AI日记的第4天。早上起来,就看到了这条报道。
现代版的“焚书”出现了。 就在此时此刻,亚马逊就在批量购书扫描用于AI训练后直接销毁。这不是小道消息,这是404Media(也就是独立调查新闻网站)在8月17日的原创报道。
原报道链接:https://www.404media.co/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-training-facility/
我个人一直是看好AI发展和人类未来的,但这种以破坏文化为代价增强AI的行为,我个人感到非常愤怒和痛心,所以发视频以个人绵薄之力,予以谴责。
一. 发现事实

他们是怎么发现的呢?404 Media通过与一位书商合作,在一本珍本图书中放置 Apple AirTag追踪设备,追踪一批约1000本图书的批量采购订单。这些书通过另外一个图书交易平台采购(Biblio),这个平台的一大特点就是可以匿名采购。这批书最终被追踪到亚马逊位于美国内华达州拉斯维加斯的一处仓库。404Media 还通过侦查发现该仓库的工人负责切除书脊以加速扫描,扫描后的数据用于训练亚马逊的 Nova AI 模型,原书在此过程中被销毁。仓库团队 VGT3 的标志是一只手持书本的霸王龙。亚马逊发言人仅回应称"通过正常商业渠道采购书籍",未提及 AI 训练。
其实在这件事发生之前,就有报道过Anthropic 内部的“巴拿马计划”,以类似方式购入数百万本书籍、切除书脊、扫描数字化后销毁原书。 注意这件事也闹上了法庭,最后是法官裁定此行为属于"合理使用“。
二. 对我们的影响
我作为一个每天都使用AI的普通人,想从短期和长期两个维度谈谈对我们的影响。
- 短期影响
先来说短期影响。喜欢淘旧书的人会最先感受到变化:珍本、绝版书、冷门学术著作正从二手市场和图书馆流通渠道中悄然消失——不是没人要,而是存世副本已被送进 AI 扫描流水线销毁。你可能某天想找一本十年前的专业书,发现全网都买不到了。
同时,AI 工具会明显变“聪明”。这些被扫描的书大多出版于 2022 年前,是纯净的人类原创文本,能提升模型的知识广度和生成质量——代价却是普通人感知不到的。
-长期影响
再来说说长期影响。
知识私有化:
我想提到的第一个词叫做“知识私有化”,书籍内容从公共领域转移到企业封闭模型内部。以前花几十块就能读到的内容,现在只存在于私有训练数据中,只能通过付费 AI 产品间接接触。人类几百年的纸质知识积累,正被少数公司“吸收”后锁进商业围墙。 从长远来看普通人获取知识的门槛在不断变高,早晚人类的智慧会被AI圈在围墙之内,让你逐渐变成只能依赖AI、失去独立思考的人。
判例效应:
第二个词叫做"判例效应"。
2025 年法官裁定“破坏性扫描”属于合理使用——这个判例的可怕之处在于它划出的边界。 它等于告诉所有 AI 公司一条清晰的合规路径:花钱买书→扫描→训练,合法;下载盗版→训练,违法。 也就是说,只要走“购买”这个动作,版权问题就基本消解了——因为书的售价里已经包含了“买断”的含义,作者拿到的就是那本书的钱,作品内容随后被如何使用(哪怕是被拆解销毁后喂给 AI),作者无权过问,也拿不到一分钱额外报酬。
也就是说这种行为目前来看在短时间内不会停止,由于商业竞争很有以后成为提高AI能力的一种必要手段。这件事决定的不仅是几家公司赔多少钱,而是“人类创作的文字内容,在 AI 时代究竟归谁支配”这个根本问题。
那到底是应该为了科技的发展,公司的竞争让这种行为继续,还是努力推翻这种行径。你们也可以说说你们的看法。
三. AI训练数据的获取策略
那我们来思考一个问题:“都知道这种行为不道德,为什么这些AI公司宁愿损害名誉也要去做?在技术上遇到了什么问题?”
AI 时代的“粮食危机” 。 大语言模型(LLM)的能力本质上来自训练数据——模型读过的每一个词都在塑造它的知识和风格。业界普遍估算,训练一个前沿模型需要数万亿 token 的文本,而且这个需求随模型规模增长而膨胀。问题在于:互联网上高质量的公开文本就那么多,维基百科、新闻档案、学术论文、书籍电子版……这些“容易摘的果子”早已被反复收割。多家研究机构(如 Epoch AI)预警,按照当前消耗速度,高质量网络文本数据将在几年内被用尽。想让自己的模型更加“聪明”,当公开网络数据见底时,AI 公司必须寻找新的数据来源——而答案就躺在书架上。
“模型崩溃”:AI 吃自己产出的恶果。 为什么不能干脆用 AI 生成的文本来训练新 AI?2024 年发表在 Nature 上的一项研究给出了警告:当模型反复训练在自己或前代模型生成的数据上时,会发生“模型崩溃”(model collapse)——模型输出的分布会在一代代迭代中不断收窄,尾部信息(罕见词汇、小众知识、多样化表达)率先消失,最终模型越来越“平庸”,甚至变得不可用。就像近亲繁殖导致基因退化,AI“吃”AI 的产出会导致认知退化。后续研究(Gerstgrasser 等,2024)补充了一个更微妙的结论:如果保留原始真实数据、不断累加合成数据,崩溃可以延缓——但这恰恰反证了一点:真实的人类原创文本是不可或缺的“基因库”,是防止模型退化的根基。
2022 年:人类知识的“纯净分界线”。 ChatGPT 于 2022 年 11 月发布,这之后互联网上的内容开始被 AI 生成物快速污染——如今部分研究估计,新增网页内容中 AI 生成的比例已相当可观,而且往往没有标注。这意味着 2022 年以后抓取的网络语料,很可能混入了机器文本。相比之下,2022 年以前出版的实体书是天然纯净的:它们成书于 AI 时代之前,每一个字都出自人类之手;而且大量书籍从未被数字化,其内容在互联网上根本不存在——AI 公司从网上爬不到,只能买实体书来扫。互联网上也有句话叫做:“世界上最好的 AI 训练数据,正躺在书架上。” 有评论一针见血:这些纸质书是“AI 开始帮人类思考之前,人类思考的最后可靠记录”——所以它们最先被吃掉。
由此形成的竞争格局。 每个新的大模型版本发布后,最新做的一件事就是跑竞赛榜单,在蒸馏横行的现在,独家数据就是护城河。谁能拿到别人拿不到的纯净文本,谁的模型就更强——而且被扫描进私有训练集的书籍内容,竞争对手永远无法使用。这解释了亚马逊为何匿名下单、切脊、扫描、销毁一条龙:不是流程有多见不得人,而是训练数据本身就是商业机密。亚马逊 VGT3 仓库员工透露,今年早些时候一度出现“无书可扫”的断供,甚至担心仓库要关停——这个细节侧面说明消耗速度之快。书商们则怀疑,AI 公司正在按 ISBN 编号系统性扫荡全球出版物:每一本有编号的书,都是清单上待勾选的一项。人类几千年的纸质知识积累,正在被逐本转化为少数几家公司的私有资产。
四. 我的总结和思考
这件事我觉得对我一个普通人的最大影响是 "知识私有化"的隐性危机。 我们关注点通常在"亚马逊毁书"这个表层事实,但更深层的问题是:被扫描的书籍内容从公共领域(书架、图书馆、二手市场)转移到了企业的封闭 AI 模型中。知识被"保存"了,但"获取权"被剥夺了——我们再也无法自由阅读这些内容,只能通过 AI 公司的付费产品间接接触。 为此我每个月要为使用Codex 5X Pro 花至少大几百的费用。当我们不再为AI Agent续费的时候,我们手里其实空无一物。
用户留言