为了在训练大模型时加速数据录入,人工智能巨头Anthropic竟毁掉了上百万本实体书。
7月20日(当地时间),Anthropic与作家群体达成的15亿美元和解协议正式获得法院批准。这一金额创下美国版权法史上和解案的最高纪录。不过,比起这笔巨额赔款,外界更把目光投向Anthropic内部一项名为“毁书”的计划。
根据法院公开的文件,Anthropic在2024年初启动了代号为“巴拿马计划”的项目。公司斥资数千万美元,从二手书商手中大量收购实体书,随后采用“破坏性扫描”的方式处理这些书籍。具体操作是用工业设备切开书脊,逐页扫描内容并存入数据库,接着将纸张销毁丢弃。据估算,已有200万册实体书因此被毁。
这种行为背后,折射出AI公司对高质量训练数据的激烈争夺。相比于互联网上那些质量参差不齐、甚至由AI自己生成的内容,经过作者创作、编辑审核及出版流程层层筛选的书籍,堪称大型语言模型的信息宝库。与非破坏性扫描相比,“破坏性扫描”能显著提升效率并降低成本。
尽管法院已认定,Anthropic通过合法渠道购书用于大模型训练属于“合理使用”,但这种毁坏书籍的做法仍引发了广泛争议。
作家的集体诉讼,揭开了Anthropic“毁书计划”的面纱
“巴拿马计划”之所以曝光,源于一场作家发起的集体诉讼。
2023年,美国恐怖小说作家安德莉亚·巴茨(Andrea Bartz)偶然发现,自己的作品出现在一个被Anthropic等AI公司广泛使用的训练文本库中。
她不愿看到自己苦心创作的成果被AI公司“窃取”,进而构建起价值数十亿美元的生意。于是,在2024年8月,巴茨联合其他作家,在美国作家协会的支持下,向Anthropic提起了集体诉讼。
随着司法调查的深入,Anthropic的数据获取手段彻底暴露在公众视野。事实上,如今备受诟病的“破坏性扫描”,其实是Anthropic在法律压力下采取的一种成本更高的数据获取方式。
法院文件显示,为了获取高质量训练数据,Anthropic最初曾通过收集盗版电子书来建立数据库。
法官在去年6月裁定,该公司将超过700万本盗版书籍保存至一个“中央数据库”,此举侵犯了作家的权利。但同时也认定,Anthropic使用合法渠道购买书籍训练模型,是对作家作品的“合理使用”。
换言之,破坏性扫描本身不违法,违法的是盗版行为。
今年7月,Anthropic与一批作者达成总额高达15亿美元的和解协议。依据协议,每本符合条件的书籍版权所有者平均可获得约3000美元的赔偿。这场历时两年的版权纠纷由此取得阶段性结果。
“破坏性扫描”,争议不止于法律层面
虽然AI模型训练被视为对书籍的“合理使用”并获法院支持,但“破坏性扫描”引发的争议早已超出法律范畴。
人们最担忧的是,珍贵书籍可能在这一过程中遭受不可逆的破坏。尽管目前尚无确凿证据表明Anthropic的项目已经销毁了具有特殊价值的珍稀书籍,但当涉及数百万册图书时,公众依然担心,一些珍贵的历史古籍和绝版书籍可能已进入AI训练的供应链。
对于AI公司而言,书籍的价值仅在于其中的文字数据。它们在扫描时未必会区分一本珍贵孤本与普通书籍的差异。然而,对于书商、收藏家、档案学者和历史研究者来说,实体书本身也是文化的一部分,其纸张、装帧、批注以及流传痕迹,都承载着无法被数字化内容替代的历史价值。
当然,也有观点支持AI公司对书籍进行大规模扫描。他们认为,与其让大量冷门旧书长期沉睡在世界某个角落,不如让它们通过人工智能系统,重新成为人类知识库的一部分。
但问题在于,AI公司的书籍数字化与公共机构推动的文化保存存在本质区别。扫描后的数据进入的是AI公司的内部数据库,而非面向公众的公共图书馆。
Anthropic对实体书籍的物理销毁,更让人产生一种“斩草除根”的感觉。这进一步加剧了人们对知识垄断的担忧,AI公司似乎正将人类共有的知识遗产私有化为独家的内部数据。
Anthropic的行为引发广泛关注,或许还有一层重要原因:“毁书”这一行为所蕴含的象征意义,以及它给公众带来的强烈负面观感。
在人类历史长河中,书籍长期被视为知识、记忆与文明传承的重要载体。保存书籍、传递思想与知识,某种程度上就是在延续文明。而历史上的大规模毁书事件,无论是秦始皇时期的焚书,还是纳粹德国时期的焚书运动,往往都与权力控制、思想压制紧密相连。
因此,当大量实体书被切割、扫描并最终丢弃时,极易引发人们的负面联想——Anthropic是否正在将原本属于全人类的文化遗产,转化为自身掌控的资源?
“毁掉书籍、投喂AI”这一极具象征意味的画面,可能恰好与当下蔓延的AI恐慌产生了共振。当一本本承载着人类文明的书籍被切割、扫描,并成为训练AI的“燃料”时,人们担心的或许不仅是某些书籍被销毁,而是人类自己创造的机器最终会反噬自身。
撰文 | 李俊浩
编辑 | 北塱 钱琪瑶









