ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Anthropic是如何毁书来训练大模型的

Anthropic是如何毁书来训练大模型的 9月8日《纽约客》杂志发布了一篇题为《毁掉书本构筑心智》Destroying Books to Build a Mind的文章讨论了AI 公司 Anthropic 为训练 Claude 模型而大规模购买并“破坏性扫描”纸质书的争议。在文章中作者从2026年初的现象开始切入当时美国和加拿大多家二手书商突然收到大量小众、冷门学术书订单买家常以神秘公司名义出现。后来人们发现这些书被送往工业扫描设施拆除装订、裁切页面、扫描成数字文本再丢弃纸质本。Anthropic 在法律文件中将该项目称为 Panama Project目标是获取“全世界所有书籍”。文章指出破坏性扫描本身并不罕见图书馆也会为数字化而拆书。真正引发担忧的是AI 公司是否在销毁稀有、珍贵书籍以及这些书被转化为训练数据后原始文本、作者背景和阅读语境是否被抹除。多位书商和专家认为Anthropic 购买的大多并非古籍或珍本而是20世纪70年代以来出版的冷门学术书、专业书和低流通书籍。这类书本来可能走向过时进入模型后或许反而能产生更大影响。法律层面法官认为使用合法获得的书籍训练 AI 属于合理使用格式转换为数字副本也可以成立。但文章强调更深层问题不是“毁书”本身而是透明度和文化意义。Anthropic 所谓“研究图书馆”并不是为了让人阅读而是为了提取数据、扩充模型记忆。研究者和用户无法知道模型吸收了哪些书也无法追踪信息来源。作者在文章的最后提出书不只是句子的集合。真正的阅读包含时间、顺序、语境、想象和人与文本的关系。大语言模型把文学和知识转化为可重组的数据可能造成一种比物理毁书更隐蔽的抹除。尽管如此作者也认为总会有人偏爱模型生成的摘要或改写内容但也会有人继续追求原始文本和真正的阅读体验。值得注意的是Anthropic将书籍认定为其大语言模型“最高质量的训练数据来源”。对于未数字化的书籍而言是否能够进入训练的数据集、如何进入训练的数据集截至目前尚未看到中国大模型公司对此实践的公开信息。Anthropic已于6月1日秘交了招股书文件草案此前预计9月上旬公开披露但目前披露时间已被至少推迟至9月下旬。Anthropic最新一轮公开披露的股权融资为5月下旬投后估值9650亿美元7月底ARR超650亿美元。市场预计公司上市后市值或超两万亿美元。不少美国投资人曾公开抱怨美国主流媒体对于AI公司的消极态度并认为美国大众对AI的悲观预期如拒绝在本地建设数据中心与主流媒体的态度有密切关系。以下为「明亮公司」编译的文章内容毁掉书本构筑心智Destroying Books to Build a MindAnthropic正试图“以破坏性方式扫描全世界所有书籍”。我们应该有多担心作者Francesca Mancino2026年初布鲁克林旧书店James Payne, Books and Prints的店主开始收到一批订单请求。他后来形容这些订单“大胆得离谱也古怪得离谱”。书本身很奇怪比如一本1998年的所谓法律生存指南《如何在纽约小额索赔法院胜诉》又比如一本2006年的学术著作《玻璃建筑文化》。下单方式同样奇怪。像Payne这样的书商通常会把库存挂在多个网站上比如AbeBooks、Alibris、Amazon和Biblio。在这些平台中Alibris通常被认为是最冷清的一条收入渠道。可突然之间Payne在Alibris上的销量从每年不到10本变成了一次处理10本书的订单而且每本均价高达75至80美元。美国各地的其他书商也报告了类似情况。Sylvia Petras是多伦多Leaf and Stone Books的店主。起初她看到美国书商在网上发布销量激增的消息时还颇为羡慕。随后订单也开始陆续流入她的店里那种羡慕很快变成了困惑。Petras拥有大量15至17世纪的印刷书以及稀缺书和学术书一些主题古怪的书比如关于污水处理厂的书突然从书架上飞速售出。和其他被小众书籍订单淹没的书商一样Petras注意到这些订单并不是以个人名义下的而是来自一些神秘的有限责任公司Green Parrot Project和Red Sparrow Project。一位要求匿名的书商决定在把一本被购买的书寄给神秘买家之前给它装上GPS追踪器。研究了几种方案后她选择了一种SmartCard设备。它看起来像信用卡。她把它放进一个小信封再把信封固定在一本精装书后封面的内侧、护封后面。随后她在线跟踪这本书的去向它从俄亥俄州Grandview Heights出发抵达伊利诺伊州Addison的一个工业园区。那里有一家名为ARC Document Solutions的公司运营着工业级扫描设施。在一段宣传视频中ARC的一位发言人解释说公司许多站点全天候运转全国范围内超过100个。他还提到一位客户雇用ARC扫描“每个月一个足球场大小、堆到四层高的箱子”。Anthropic是Claude系列大型语言模型背后的人工智能公司。它正试图尽可能多地获取纸质书。我们知道这一点是因为Anthropic自己的法律文件。这些文件在2024年针对该公司提起的一起版权诉讼中被解封。Anthropic将书籍认定为其大语言模型“最高质量的训练数据来源”之后启动了一个名为Panama Project的秘密项目。法院文件对这个项目的简洁定义是“我们以破坏性方式扫描全世界所有书籍的努力。”“破坏性扫描”的意思非常准确根据法院文件Anthropic或其关联方“拆掉纸质书的装订将书页裁切成可操作尺寸然后扫描这些页面在创建数字副本的同时丢弃每一本纸质书”。这个过程会使用液压切割机也就是所谓“书籍断头台”。听起来很阴森但这种做法其实相当常见。大学的文献保存部门经常会拆掉书的装订以便更容易扫描。当然毁掉一本书并不是扫描它的唯一方式。普林斯顿大学图书馆在数字化文本时会特别保留实体副本即便这会让流程效率降低。普林斯顿大学英语教授、数字人文中心教务主任Meredith Martin告诉我“在不压平书本的情况下拍摄影像、保留书本完整性是完全可能的只是成本更高。”不过Martin和其他专家也强调旧书一直会被丢弃随后被销毁甚至不一定出于学术原因。有些图书馆只是为了清理馆藏。捐赠当然更容易让人接受但要处理一本过时的说明手册或教材或者几本破旧的同一大众平装书并不容易。有些书甚至不会被监狱图书馆接收因为后者通常拒收精装书或品相很差的书。结果这些书可能最终进入垃圾填埋场也可能根据装订方式被拆解、打浆回收或者被粉碎。休斯敦学术图书馆员Claire Sewell曾在Medium上发文为图书馆“剔旧”书架辩护。她承认“看到一整只垃圾箱里装满书似乎完全背离了图书馆作为知识储藏所所应代表的一切。”然而“旧的、过时的、损坏的或者单纯借阅率很低的书必须定期剔除这样我们才能为你真正想借的新书腾出空间。”让Anthropic项目引发争议的并不是人们担心它会毁掉一本被水泡坏的《秘密》而是担心它毁掉真正稀有且有价值的书。为了满足对数十亿页内容的饥饿需求Anthropic一开始向批发商大规模下单随后转向个体书商和二手书商以填补缺口。该公司对冷门文本的兴趣引发了一些标题说AI公司正在购买并销毁“罕见旧书”或“古董书”。这些说法通常会让人联想到初版书。随着Anthropic这类AI公司的崛起确实出现了许多正当的伦理担忧。但销毁珍贵书籍未必是其中之一。Anthropic的一位发言人在声明中写道“我们的任何数据获取项目都不会购买并销毁稀有书或古籍。”这里的“古籍”指至少有100年历史的书无论是否稀有。美国古籍书商协会表示没有任何会员向其报告称这类书被卖给了AI公司。我采访过的个体书商中也没有人把古籍卖给看起来像AI公司的买家。相反他们卖出的多数书都有ISBN也就是唯一数字识别码ISBN直到1970年才开始使用。多伦多书店店主Petras说她总体上愿意把书卖给隐藏身份的买家但绝不会把带有有趣边注或重要来源背景的书卖给他们。波士顿Brattle Book Shop的店主之一Joyce Kosofsky说她卖出的书都有多本复本。“我们可能是价格最低的那家”她猜测道。她认为总体上书和任何其他可出售商品并无不同“就像你走进服装店买一条牛仔裤那就是你的牛仔裤。你可以穿可以装饰可以送人。不会有人跟着你问‘你打算拿你的牛仔裤做什么’”既然Anthropic购买的书“很可能并不非常稀有”普林斯顿教授Martin说该公司使用书籍断头台的做法不应被视为煽动性问题。但如果这些书并不稀有那它们到底是什么书商们分享了600多个书名他们认为这些书已经被卖给AI公司。我把这份清单发给华盛顿大学信息学院助理教授Melanie Walsh请她进行数字化处理。这些文本的特点是主题冷门、受欢迎程度低。有些书印量很小通常1000册或更少以满足现实市场需求。在排名前十的出版社中有八家是大学出版社整体样本中大约三分之一来自学术出版社。多数书出版于20世纪70年代到2010年代之间体裁涵盖历史、传记、小说、诗歌、文学批评、法律和社会科学。Walsh总结说“从这个样本看AI公司似乎可能有兴趣用范围广泛的、经过同行评审的学术研究来训练模型。”这与Anthropic研究科学家Mycal Tucker在组织AI模型训练数据时的发现相吻合。Tucker在书面证词中说“非虚构作品往往比虚构作品更有价值。”他还补充说非虚构书籍数据帮助模型在哲学、天文学等差异很大的学科中表现良好。Walsh说对于一些高度专业化的非虚构作品比如Petras最近卖出的一本1972年小册子《城市污水污泥利用》“可以提出这样一种观点这些冷门学术书作为Claude模型的一部分可能比以其他方式存在产生更大影响。”毕竟它们原本就正在走向过时。Anthropic试图获得“全世界所有书籍”的努力也引发了法律挑战。2025年该公司同意支付15亿美元以和解一群作者提起的集体诉讼。这些作者指控Anthropic侵犯其版权具体而言是未经许可使用他们的书进行AI训练。负责该案的法官William Alsup谴责了Anthropic的一些行为例如下载超过700万本盗版书并将这些文件保留为“永久性的通用资源”即便它们并未被用于训练Claude。Alsup在裁决中写道“Anthropic似乎认为因为它复制的一些作品有时被用于训练大语言模型所以Anthropic就有权免费拿走世界上所有作品并永远保存而不需要进一步交代。”但根据Alsup的判断使用书籍训练AI模型这一更大范围的做法属于合理使用。他写道“作者不能正当地排除任何人使用其作品进行训练或学习。”他还说“每个人也会阅读文本然后写出新的文本。他们最初获取文本时也许需要付费。但如果要求任何人在每次阅读一本书、每次从记忆中回想它、每次后来以新的方式写作并借鉴它时都专门为使用这本书付费那将不可想象。”版权律师、Re Coalition执行主任Brandon Butler将AI训练描述为“版权法历史上最公平的使用”。Re Coalition是一个倡导组织同时支持专有作品创作者及其用户。Butler认为这是因为AI训练“从既有文化中取走的只是事实上属于我们所有人的东西事实、思想、语言和语法元素并让所有人更容易使用这些东西”。如果大语言模型逐字复述记忆材料或传达受保护的表达版权可能会被侵犯。但它们通常传达的是不受保护的信息而且表达方式与原始来源的措辞不同。Butler说从这个意义上讲AI公司和作者之间并不存在市场竞争因为一个人如果看到一本书的意译摘录仍然有动力购买那本书。当然这个问题也会因某些大语言模型偶尔“记住”几乎整部小说而变得复杂包括Meta的Llama。根据Alsup法官的判断Anthropic销毁其合法获得的纸质书也在其权利范围内。他写道“Anthropic购买了数百万本纸质书‘用以建立研究图书馆’。它销毁每一本纸质书同时用数字副本替代供其图书馆使用这些副本并不在公司外部共享或出售。”由于这种格式转换是为了便利即更便于存储和搜索并且没有增加原书副本数量因此属于合理使用。但撇开合法性不谈如果Anthropic对“研究图书馆”一词的理解与我们的理解差异如此之大以至于让这个说法近乎用词不当那么即便只在语言层面我们也会遇到困难。Butler解释说“他们并不是在建一座图书馆因为也许有一天会有人想读完这些书。他们也没有兴趣帮助其他人阅读这些书。他们真正想要的是数据。”他们的数字馆藏被构建出来唯一目的就是扩充Anthropic大语言模型的“记忆”并磨炼其写作能力。结果是即便这些模型确实成功保存了那些本可能因时间流逝或兴趣衰退而失落的文学材料源头也将始终处在阴影中。研究者无法访问这些图书数据用户也无法控制或观察信息是如何被提供给自己的。HathiTrust执行主任Mike Furlough告诉我我们有权要求AI公司更透明地说明其数据集是如何创建的尽管它们的使命并不是分发书籍而且公开这些数据可能牺牲其竞争优势。图书馆和学术研究者被要求遵守严格得多的标准。Furlough说“一个想要制作小型语言模型的学术研究者会被要求披露他们使用过的完整书目。”他继续说“这只是普通学术惯例因为你希望其他人能够复现或者理解其中使用了什么。”任何普通人用于研究的可靠工具基本上也是如此即便是维基百科也包括引用。Anthropic想把“全世界所有书籍”聚拢起来这个目标本来几乎可以令人兴奋问题在于这个假想的书面知识库只会存在于Claude的数字深处。历史学家Leah Price在2019年出版的一部关于书籍媒介的非虚构史中写道“每一代人都会重写书的墓志铭。改变的只是凶手是谁。”19世纪人们怀疑的凶手是图书馆。在伦敦印刷的一本小册子《公共借阅图书馆向读者免费开放书籍的真相》中一位匿名作者试图揭露免费开放的可怕现实声称它会导致图书被盗和“错放”。更近一些人们的恐惧则集中于电子书和Kindle的出现。在《当我们谈论书时我们在谈论什么》中Price指出书一直具有变色龙般的特质。它们会随着技术创新而适应变化而且这两者并不必然始终处于张力之中。然而作为读者、作为文学消费者意味着什么这一概念也开始发生转变。Price在给我的电子邮件中表达了担忧一种正在逼近的威胁是“AI将取代人类读者”因为“破坏性扫描为了单次机器阅读牺牲了未来多次潜在的人类阅读”。书自带历史与语境baggage)而AI把这些都剪除了。书要求我们投入时间、参与和思考每一本书都有一套独特的阅读要求。作家Catherine Gallagher在2006年的文章《虚构性的兴起》中探讨18世纪小说写作的扩散。她列举了早期小说如何要求读者投入注意力和参与要求读者“预判问题、作出假设性预测并看到可能的结果和替代性解释”。Price告诉我如果一个人仍然相信阅读是一种“想象性的、沉浸式的体验”那么在人类无中介地阅读与机器人替用户阅读并提取有价值内容之间就存在关键差异当涉及标志性文学作品时尤其如此。Price说“一部小说不只是一桶句子。这些句子出现的顺序很重要。”然而Anthropic的目标似乎正是不断积累并吐出越来越多的桶。弗吉尼亚大学教授Matthew Kirschenbaum警告说如果“书的巨大美德”被溶解进数据中会发生什么。书作为一个自足对象而存在有人类作者也有人类历史而数据会把所有上下文从原作中抽离。书的边界例如封面与物质性、出版信息和作者在文本被“同质化”、并且“失去其在原书中存在的所有关系”时消失了。因此保护AI免于版权侵权的恰恰也是问题所在它能够改写措辞。大语言模型把文学转化成某种混合的、半死不活的东西距离原始来源极其遥远即便不是完全脱离原始来源。它创造出一种如此剧烈更新的产品以至于文本作为一个独立作品实际上被毁掉了。这种不那么显眼的抹除比破坏性扫描更危险也更令人担忧。即便如此我仍然怀疑通过大语言模型获取信息是否永远只会吸引一部分人。这里可以和18世纪小说的兴起作一个类比。笛福的《鲁滨逊漂流记》和塞缪尔·理查森的《帕梅拉》分别于1719年和1740年出版后在整个18世纪剩余时间里多次印刷都销售一空。竞争者看到出版社为了满足需求不断印刷于是想出一种快速赚钱的办法出版各种盗版版本。这些二流版本包括适合儿童阅读的版本、保留最精彩或最刺激部分的删节本、单纯比完整版更便宜的短版以及未经授权的续集。这些盗版书也极其流行尽管人们仍然继续寻找原始文本。我们可以把这些18世纪消费者分成两类一类购买并阅读笛福和理查森写下的小说另一类则偏爱被改写或模仿的版本。一直以来都有或许将来也始终会有一些人相比原始来源更喜欢劣质内容。原文链接Anthropic是如何毁书来训练大模型的-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
返回列表