这件事藏了两年,终于被揭开了。
2024年4月,Anthropic内部流传了一份文件,代号叫"巴拿马计划"。目标写得直白:破坏性扫描全世界的书。文件原话说"我们用一个软代号,因为不想让人知道我们在做这件事。"2026年1月,法官下令解封4000多页诉讼文件,这份备忘录彻底曝光。
与此同时,Reddit也正式起诉了Anthropic,指控其非法访问网站10万次,用用户数据训练AI模型。要知道,Reddit之前跟OpenAI、谷歌都签了数据合作协议,唯独Anthropic是"不遵守规则"的那一个。
为什么叫"巴拿马计划"
巴拿马运河是人类工程史上的奇迹——用一条水道连接两大洋。Anthropic给这个项目取这个名字,意思很明确:他们想建一条"数据运河",把人类几百年积累的知识,从纸质载体搬运到AI训练集里。
具体操作是这样的:收购或获取大量旧书,把书脊切掉,用高速扫描仪逐页扫描,然后通过OCR和结构化处理,变成训练数据。数百万本书,目标是"破坏性"扫描——也就是说书扫完就没了,物理实体被转化为数字数据。
这件事为什么重要
大模型训练需要海量数据,这大家都知道。但数据的来源一直是个灰色地带。之前各家公司基本是"先用了再说"——网上的文本、书里的内容、论坛的帖子,能抓就抓。版权问题?等被告了再说。
Anthropic这次被曝光,说明这个灰色地带正在被一条一条地画上红线。法官解封诉讼文件、Reddit主动起诉,这些信号都指向同一个方向:AI训练数据的合规窗口正在关闭。
对中国AI行业意味着什么
国内目前在这方面的法律框架还在完善中,但趋势已经很清楚了。杭州最近公布了全国首例AI大模型商业秘密刑事案,12年老员工窃取垂类模型核心资料获刑。这说明司法层面对AI数据和知识产权的保护力度在快速升级。
对于做AI的公司来说,数据的获取方式会越来越规范。未来的竞争,可能不是谁的模型更大、参数更多,而是谁有合法、高质量、独家的训练数据。数据壁垒,可能比算力壁垒更难突破。
一个更大的问题
人类几百年来写在书里的知识、经验和思想,该不该被拆解成训练数据?这个问题没有简单的答案。从技术进步的角度看,这是AI能力跃升的关键燃料。从知识生产的角度看,如果作者没有获得任何补偿,这跟知识掠夺有什么区别?
2026年,AI训练数据这件事,正式从灰色地带进入了法律对抗阶段。这场博弈才刚刚开始。

书被拆了变成数据,那数据生成的内容算不算书的延续?? 这个问题够哲学家们吵一阵子了
以后做AI是不是先得解决版权问题...感觉这才是最难的
Reddit起诉这事有意思,跟OpenAI谷歌都签了协议,就Anthropic不签。不是不能合规,是觉得不需要合规。现在被打脸了。
"用软代号因为不想让人知道"——这话要是没被法官解封,谁知道还在藏着呢 ? Anthropic可是主打"安全"的公司啊
从商业角度看,谁手里有合法授权的数据集,谁就是下一个时代的"地主"。AI训练数据合规这个赛道,值得重点关注。