美国 AI 企业上演现代焚书坑儒?700 万数据背后藏着垄断阴谋

美国 AI 企业的操作让人后背发凉,这简直是现代版的焚书坑儒。

近年,美国 AI 公司 Anthropic 秘密启动了代号为巴拿马计划的项目。他们从二手书市场大量收购纸质书,扫描成数字文件用来训练 AI,之后直接把原版书销毁。这个计划跑了快两年,才被媒体捅出来。

今年年初,《华盛顿邮报》查到一批解封的法庭文件,发现 Anthropic 的内部文件里,把项目目标写成 “破坏性扫描全球所有图书”,还特意强调不想让外界知道这事。这事一曝光就炸了锅,大家都担心 AI 企业要垄断人类知识。

其实 Anthropic 不是独一份。Meta、谷歌、OpenAI 这些美国科技公司,早就围着人类作品打秘密仗了。美国 AI 企业大多用闭源模式,都想垄断优质的 AI 训练资源,把对手挤出去。他们都赌着 AI 会变成未来人类接触知识的唯一渠道,说白了,谁攥着最好的 AI,谁就能控制人类的思想。

早在 2022 年,Anthropic 就靠多个盗版网站攒了 700 多万份图书副本的内部库,用来训练大语言模型。大语言模型得读大量人类作品,才能学会词语搭配和文章结构。这话不假,训练素材越多越优质,AI 理解和写东西的能力就越强。

但正规渠道拿图书版权,不仅耗时间,花钱还多。OpenAI、谷歌、Meta 这些公司,都靠盗版网站拿过不少资源。但后来 AI 版权官司越来越多,靠盗版网站迟早要赔大钱。所以近年 Anthropic 搞了巴拿马计划,转头去收正式出版的纸质书。

比起网上零散重复、没经过编辑的文字,纸质书结构更完整、质量更高,而且老书更少被 AI 生成的内容污染。今年初,他们雇了曾管谷歌图书项目的汤姆特维,从大型书商和二手书店批量收书,一次就能收几万册。

这些书集中运到仓库登记后,就送去专业扫描公司。扫描的时候,工人会拆开封皮和装订,用液压切割机把书切开,书页摊平调整成统一尺寸,送进高速扫描仪,转成能检索的数字文件。扫完之后,原版书不会复原,直接彻底销毁。

去年 8 月,作家安德烈亚・巴茨等人以版权侵权为由,把 Anthropic 告了,还拉了集体诉讼,说公司没权这么毁人类的作品。11 个月后,美国加州北区联邦法院判 Anthropic 没违法,法院的理由是,只要 Anthropic 不卖或者分享扫描出来的数字文件,怎么处理原版书是公司自己的事。

今年年初,《华盛顿邮报》从解封的法院文件里挖出巴拿马计划,Anthropic 大规模毁书的事立刻引发争议。大伙这才反应过来,科技公司的目的没那么简单。嘴上说破坏性扫描是为了省事儿,不用再装订、存书,省人工和仓储费,但他们销毁的书里,有不少珍贵的藏本,甚至是孤本。

美企销毁百万珍贵藏本只为垄断 AI 训练数据,把原版书毁了,把数字资源攥在自己手里,就能垄断这部分信息,不让对手拿到。现在各大公司抢 AI 性能抢得凶,优质训练素材可是稀缺的好东西。法院判决给闭源垄断开了绿灯,等于给其他科技公司的破坏性扫描开了绿灯。

美国 AI 企业为啥这么热衷于垄断知识?根子在他们的闭源商业模式。西方有句谚语:通往地狱的路,往往是用善意铺成的。但在 AI 行业,商业模式才是一切的根。

今年年初,美国大型图书批发商英格拉姆说,越来越多的 AI 公司开始买纸质书和其他载体,用来扫描训练 AI。今年夏天,美国、英国、爱尔兰、澳大利亚还有欧洲大陆的一些二手书店,都接到了数量反常的大额订单。这说明不止 Anthropic 一家这么干,越来越多的书正从公开市场流入企业的私人数据库。

这事儿的根子,还是美国 AI 企业普遍用的闭源模式。所谓闭源模式,就是企业不对外公开核心模型的参数和关键代码,用户只能用他们提供的接口用 AI。为了保住竞争优势,企业就得想法子不让对手拿到更好的模型能力。所以每家公司都想垄断优质训练资源,在竞争压力下都选了同一条路:扩大自己的数据库,把信息攥在自己手里。

每家企业都按自己的利益做决定,最后结果就是少数科技公司拼命想垄断人类知识。和美国闭源模式不一样的,是 Deepseek、通义千问这些中国企业的开源模式。

这些企业不仅公开模型参数和代码,还允许开发者下载、部署、修改,甚至二次开发。开发者可以根据自己的设备和需求,选合适的模型本地化部署,还能针对所在行业做调整。在这种模式下,没人会费尽心思垄断人类知识 —— 所有资源和成果都是公开共享的,不属于某一家公司。

开源模式降低了 AI 行业的门槛,小公司不用砸大钱从头训练基础模型,只要在公开模型里加上自己行业的信息,就能开发面向制造、医疗、农业或者教育的工具。不同群体也能建自己的知识系统,地方机构能加本地资料,专业机构能做针对特定行业的知识工具。

这种模式的利润来源,不再是 “只有我能用这个模型”,而是 “我能提供更方便、更稳定的服务”。一家公司成功了,不代表其他企业就没法进这个行业,反而会有更多企业和应用围着它转。

这么看的话,开源和闭源不只是 AI 技术路线的区别,更是两种完全不同的社会未来。闭源就是集中化、私有化,模型能力、数据资源、平台规则都攥在少数甚至一家企业手里。开源则代表了真正惠及大众的普惠逻辑,普通人和小企业可以共同参与并共享模型的能力。

未来 AI 走哪条路,决定了人类以后怎么获取知识,能不能继续参与知识的生产和传播。开源和闭源的争论,本质上是人类在两种社会运行方式之间做选择。

展开阅读全文

更新时间:2026-09-01

标签:科技   焚书坑儒   美国   阴谋   数据   企业   模型   公司   人类   知识   巴拿马   模式   纸质   文件

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top