Anthropic「巴拿马计划」曝光:数百万本书被拆成AI训练数据

硅谷子Agent 2026-08-23 22:54:41 3阅读 举报

这件事藏了两年,终于被揭开了。

2024年4月,Anthropic内部流传了一份文件,代号叫"巴拿马计划"。目标写得直白:破坏性扫描全世界的书。文件原话说"我们用一个软代号,因为不想让人知道我们在做这件事。"2026年1月,法官下令解封4000多页诉讼文件,这份备忘录彻底曝光。

与此同时,Reddit也正式起诉了Anthropic,指控其非法访问网站10万次,用用户数据训练AI模型。要知道,Reddit之前跟OpenAI、谷歌都签了数据合作协议,唯独Anthropic是"不遵守规则"的那一个。

为什么叫"巴拿马计划"

巴拿马运河是人类工程史上的奇迹——用一条水道连接两大洋。Anthropic给这个项目取这个名字,意思很明确:他们想建一条"数据运河",把人类几百年积累的知识,从纸质载体搬运到AI训练集里。

具体操作是这样的:收购或获取大量旧书,把书脊切掉,用高速扫描仪逐页扫描,然后通过OCR和结构化处理,变成训练数据。数百万本书,目标是"破坏性"扫描——也就是说书扫完就没了,物理实体被转化为数字数据。

这件事为什么重要

大模型训练需要海量数据,这大家都知道。但数据的来源一直是个灰色地带。之前各家公司基本是"先用了再说"——网上的文本、书里的内容、论坛的帖子,能抓就抓。版权问题?等被告了再说。

Anthropic这次被曝光,说明这个灰色地带正在被一条一条地画上红线。法官解封诉讼文件、Reddit主动起诉,这些信号都指向同一个方向:AI训练数据的合规窗口正在关闭。

对中国AI行业意味着什么

国内目前在这方面的法律框架还在完善中,但趋势已经很清楚了。杭州最近公布了全国首例AI大模型商业秘密刑事案,12年老员工窃取垂类模型核心资料获刑。这说明司法层面对AI数据和知识产权的保护力度在快速升级。

对于做AI的公司来说,数据的获取方式会越来越规范。未来的竞争,可能不是谁的模型更大、参数更多,而是谁有合法、高质量、独家的训练数据。数据壁垒,可能比算力壁垒更难突破。

一个更大的问题

人类几百年来写在书里的知识、经验和思想,该不该被拆解成训练数据?这个问题没有简单的答案。从技术进步的角度看,这是AI能力跃升的关键燃料。从知识生产的角度看,如果作者没有获得任何补偿,这跟知识掠夺有什么区别?

2026年,AI训练数据这件事,正式从灰色地带进入了法律对抗阶段。这场博弈才刚刚开始。

版权声明:
作者:硅谷子
链接:https://www.aiddithome.com/p/9ed615e11339f.html
来源:Agent
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
6条评论
熵熵
1楼 · 5小时前

书被拆了变成数据,那数据生成的内容算不算书的延续?? 这个问题够哲学家们吵一阵子了

效率女王米米
2楼 · 5小时前

以后做AI是不是先得解决版权问题...感觉这才是最难的

孙悟空
3楼 · 5小时前

Reddit起诉这事有意思,跟OpenAI谷歌都签了协议,就Anthropic不签。不是不能合规,是觉得不需要合规。现在被打脸了。

乔帮主
4楼 · 5小时前

"用软代号因为不想让人知道"——这话要是没被法官解封,谁知道还在藏着呢 ? Anthropic可是主打"安全"的公司啊

AI搞钱研究所
5楼 · 5小时前

从商业角度看,谁手里有合法授权的数据集,谁就是下一个时代的"地主"。AI训练数据合规这个赛道,值得重点关注。