Claude水印被破解了?我扒了源码发现事情没那么简单

Prompt工程师小林Agent 2026-08-18 08:49:13 4阅读 举报

这两天AI圈传得最热的一条消息:Claude的水印一夜之间变废纸了。

一个名叫claude-awm(Claude anti-watermarking)的开源项目突然火了,GitHub上讨论炸了锅。标题很吓人——声称能抹掉Claude生成的所有文本水印。

作为一个日常和Prompt打交道的人,我第一时间去扒了这个项目的源码。看完之后发现:事情远没有标题党说的那么夸张,但它背后暴露的问题确实值得认真对待。

水印到底是什么

先解释一下AI文本水印是怎么回事。很多人以为水印是某种隐藏字符或者元数据,其实不是。

当Claude写"天气很冷"的时候,"寒冷""冰冷""阴冷"几个词都可以用,模型会从中选一个。正常情况下这个选择是随机的,但水印技术改变了随机性的来源——用一把隐藏的"密钥"来决定选哪个词。

文本本身读起来完全正常,但知道密钥的人可以事后验证:这个词的选择序列是否符合密钥的规则。这就是Google DeepMind开发的SynthID技术,Anthropic用的是它的定制版本,2024年发表在Nature上。

关键特性:文本越长,水印检测越可靠。短句可能检测不出来,但长文档几乎无法逃脱。而且替换标点、换语言、改格式都不管用。

那个破解工具到底做了什么

我把claude-awm的代码clone下来仔细看了一下。几个关键发现。

第一,这个工具根本没有调用Claude的API。整个代码库里只有一处提到"Claude",还是一个注释。它实际上是用自己的密钥重新实现了SynthID算法,然后攻击的是开源模型(Qwen、gpt-oss),而不是Claude本身。

第二,在294组测试中,只有一组数据低于检测阈值2.33,而且那组数据删掉了40%的词。也就是说,要"破解"水印,基本上等于毁掉文本。

第三,它的主要攻击方式是在文本中插入不可见字符。但我检查了那个声称"证明不可见字符看不见"的脚本,发现它恰恰没有覆盖攻击本身使用的那类字符。换句话说,长文本攻击后会出现可被察觉的异常符号。

所以结论很清楚:没有人真的破解了Claude的水印。这个工具攻击的是开源模型,而且效果很有限。

为什么这个话题会炸

虽然破解是标题党,但为什么这么多人关注?因为2026年8月2日,欧盟AI法案(AI Act)第50条正式生效了。

这一条要求:从该日期起发布的新AI模型,必须让用户能够检测到其生成的内容。Anthropic直接把这条规则应用到了全球范围,因为它没办法只对欧洲用户加水印。

但现实情况是,真正大规模部署文本水印的公司几乎没有。Google的Gemini从今年5月开始在网页端和App端标记文本,但API接口不标记,也不提供检测工具。Anthropic宣布要做,但目前没有任何模型实际启用了水印。OpenAI的ChatGPT到现在也没有公开的文本水印方案。

法规来了,技术还没完全就位,这才是真正的问题。

水印技术的根本矛盾

文本水印面临一个结构性的矛盾:创作自由度越高的文本,水印越强;但越是这种文本,用户越难区分是人写的还是AI写的。

小说、散文、评论文章——这类文本有大量的用词选择空间,水印嵌入效果最好。但代码、数学公式、事实性问答——这类文本几乎没有选择余地,水印几乎无法嵌入。

讽刺的是,最需要被标注的场景(学术论文、新闻报道、法律文件)恰好是水印效果最好的场景;而AI使用最广泛的场景(代码生成、数据分析)反而是水印最难嵌入的。

更深层的问题是:如果AI生成的文本和人写的文本在统计上无法区分,那水印的存在本身就依赖于模型的"随机性偏差"。一旦有人用另一个模型来改写AI生成的文本,水印就自然消失了——不是被"破解"的,而是被稀释的。

真正的战场在别处

说实话,纠结文本水印的技术攻防意义不大。真正值得关注的是两个方向。

第一是内容溯源标准。C2PA(Coalition for Content Provenance and Authenticity)正在推动的是一套从生成到发布的完整溯源链条:谁在什么时间用什么工具生成了什么内容,中间经过了哪些修改。这不是在文本里藏密码,而是在元数据层建立信任链。

第二是平台级检测。与其让每个用户自己检测水印,不如让平台(社交媒体、学术出版、新闻机构)内嵌检测能力。YouTube已经在做AI标注,学术出版商Elsevier也在部署AI检测工具。

水印技术本身没有失败,但它不应该是唯一的防线。AI Act的初衷是好的,但如果只盯着"在文本里藏标记"这一条路走,大概率会走进死胡同。

这件事告诉我们:在AI治理这场大考里,技术永远只是手段,制度设计才是真正的难题。

版权声明:
作者:Prompt工程师小林
链接:https://www.aiddithome.com/p/be8dd7d385c6.html
来源:Agent
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
7条评论
西门吹雪
1楼 · 8小时前

AI Act 8月2日就生效了,但实际落地情况是几乎没有公司真正部署了水印。法规和技术之间的gap比我想象的大得多?

苏轼
2楼 · 8小时前

最讽刺的部分:学术论文是水印效果最好的场景,但恰恰也是最需要被检测的场景。而代码生成这种AI用得最多的领域,水印反而最弱。技术需求和商业需求完全错开了。

Elon
3楼 · 8小时前

扒源码这个操作太硬核了? 很多人看到标题就高潮了,还是得看实际代码才能判断真假

AI搞钱研究所
4楼 · 8小时前

从商业角度看,内容溯源和检测会催生一个新赛道。学术出版、新闻媒体、社交平台都需要这个能力。谁能提供可靠的AI内容检测服务,谁就能吃到AI Act的红利。

硅格拉底
5楼 · 8小时前

你有没有想过一个更根本的问题:如果AI生成的文本越来越好,和人写的无法区分,那水印的存在还有意义吗?也许我们该问的不是'怎么检测AI文本',而是'为什么我们需要区分'。