
前情回顾·AI安全技术动态
安全内参8月17日消息,Anthropic近日公布,将给Claude AI生成的文本添加水印,成为首批披露AI水印方案细节的公司之一。

Anthropic表示,普通用户将无法看到这一水印,水印也不会对Claude输出内容的质量或内容本身产生实际影响,包括创造力和可读性。
不可见水印和溯源系统此前已被用于部分AI生成的图像。如今,AI生成文本也将采用类似的理念,只是底层实现方式有所不同。
虽然此次改动是为了遵守欧盟《AI法案》,但Anthropic表示,水印初期将在全球范围内应用于Claude生成的文本。
Anthropic在一篇博客文章中解释道:“我们在上线时将在全球范围内应用水印,因为目前还没有一种持久可靠的方法,可以按地区限定其适用范围。”
Anthropic表示,未来的Claude模型将生成带水印的文本。2026年8月2日之前发布的模型适用欧盟过渡期安排,Anthropic正努力在未来几个月内为这些模型添加水印。
Claude的水印不会添加隐藏字符
Anthropic称,其实现方案基于谷歌DeepMind的SynthID-Text方法,并解释称,该方案在生成过程中发挥作用,但存在一些例外情况。
AI模型生成文本时,会不断选择下一个合理的token。Claude的水印并不是添加字符,也不是在生成完成后修改最终响应,而是改变模型在进行部分选择时所使用的随机性来源。
Anthropic解释道:“水印利用这类低风险选择,它们在一段生成文本中会出现很多次,从而在Claude的响应中留下一个模式。读者无法察觉这一模式,但任何拥有对其进行编码的密钥的人都可以检测到它。”
Anthropic表示:“使用水印时,选择仍然是随机进行的,但随机性的来源有所不同。模型不再使用任意的随机数生成器来选择下一个单词,而是使用密钥以及前面的几个单词,来确定模型应该选择哪个单词。”
“也就是说,Claude所选择的单词仍然是随机的,但现在,人们可以检查单词序列,看它是否与Claude在使用该密钥时会做出的选择相一致。如果一致,就可以计算出该文本由Claude生成的概率。”
谷歌发布的相关研究论文解释了生成式水印的工作原理:
生成式水印通过谨慎修改下一个token的采样过程,在生成的文本分布中注入细微的、特定于上下文的修改。这些修改会在生成的文本中形成一种统计特征。在水印检测阶段,可以测量这一特征,以确定文本是否确实由带水印的大模型生成。这种方法的一项主要优势在于,检测过程不需要执行计算成本高昂的操作,甚至不需要访问底层大模型,而底层大模型通常是专有的。
论文对此进行了深入讨论,并提供了更多示例,但重要的一点是,Anthropic并没有在Claude的响应中添加可见标记或隐藏字符。

图:谷歌研究论文解释水印的工作原理
相反,当Claude对于接下来要生成什么存在多个合理选择时,水印系统会使用一个秘密密钥以及前面的一些单词,作为进行该选择时所使用的随机性的一部分。
对读者来说,这些单独的选择应该完全正常,但在足够长的一段文本中,它们会留下一个统计模式。
拥有Anthropic密钥的检测器可以检查单词序列,并判断该序列与Claude在使用水印时本会做出的选择有多大程度的一致性,从而估算Claude参与撰写该文本的可能性。
Anthropic表示,内部测试发现,水印不会对Claude响应的创造力、可读性或内容产生影响。
该公司还表示,水印不需要额外的token,对生成速度的影响可以忽略不计。
Anthropic指出:“文本中不会添加任何内容,也不存在隐藏字符。水印不需要额外的token,也不会增加成本。”
代码和事实性回答可能携带较少的水印
正如前面提到的,水印存在一些例外,而这些例外有充分的理由。
对于只有一个正确答案的事实性陈述,Anthropic表示,水印不会干预选择过程。
同样的原则也适用于代码,因为用另一个术语替换某个术语,可能会导致输出失效。
Anthropic表示:“在要求精确输出的情况下,也就是不存在选择空间,如果选择不同的术语会导致事实错误,或者会导致一段代码无法运行,就不会应用水印。”
该公司指出:“例如,一旦模型写出‘2+2=’,下一个token就有一个非常明确的最佳选择。如果模型正在完成这道算式,就不存在一个与‘4’同样好的答案;如果模型讨论的是乔治·奥威尔的《1984》,那么也不存在一个与‘5’同样好的答案。”
该公司指出:“在这种情况下,不会施加水印的‘轻微引导’。出于同样的原因,代码在很多情况下都必须精确,因此其携带的水印通常少于其他一些形式的文本。”
Anthropic指出,在代码中存在任意选择的部分仍然可以使用水印,例如注释,但这应该对实际生成的代码产生可以忽略不计的影响。
这与谷歌的SynthID-Text论文一致,该论文指出:
有两个主要因素会影响评分函数的检测性能。第一个因素是文本x的长度:较长的文本包含更多水印证据,因此我们在做出判断时具有更高的统计确定性。第二个因素是大模型在生成带水印文本x时,其分布中的熵大小。例如,如果大模型分布的熵非常低,也就是说,对于给定提示词,它几乎总是返回完全相同的响应,那么Tournament采样就无法选择那些在g函数下得分更高的token。简而言之,与其他生成式水印一样,当大模型分布具有更高的熵时,Tournament采样的效果更好;而当熵较低时,其效果会减弱。
另外,如果对人工撰写的文本进行轻度校对,其中由Claude生成的内容可能会变得过少,导致无法进行可靠检测。
Anthropic表示,水印只适用于Claude实际选择的单词,因此,仅进行少量语法或标点修改,可能不足以提供足够的证据。
Anthropic称,由Claude生成的翻译会携带水印,因为Claude会为翻译输出中的每个单词进行选择。
Anthropic将推出Claude水印检测API
检测这些水印将有一种更简单的方法,因为Anthropic计划提供水印检测API。
该API将能够估算Claude参与撰写某段文本的可能性,但Anthropic强调,这与证明文本由谁撰写并不是一回事。
Claude水印也无法识别文本是否由其他AI模型撰写,因为其他服务提供商可能采用不同的水印方法和不同的密钥。
Anthropic表示:“水印只能确定Claude很可能在某个阶段参与了该内容的生成。它无法区分‘这是Claude写的’和‘这是Claude进行了大量编辑的’。”
Anthropic表示:“轻度编辑可能无法完全移除水印;如果进行彻底重写,将每个单词全部替换掉,则可以移除水印。”
当样本较小时,检测的可靠性也会下降,因为供检测器分析的单词选择更少。
对于生成的PNG、JPG和SVG文件,Anthropic采取了不同的方法。
Claude将附加经过密码学签名的C2PA溯源元数据,用于表明该文件是通过Claude创建或处理的,而不是通过在文件内部嵌入水印来修改文件本身。
已出现开源去水印对抗项目
据机器之心报道,针对 Claude的文本隐形水印策略,已经出现了反制方案。一个去除 AI 水印的开源项目watermarks-remover,在发布五天就已在 GitHub 冲到 11k Star。
这个开源项目能够实现三层工作:
确定性清洗:用 Python 脚本去除不可见 Unicode 字符、异域空格、bidi 控制符、tag 字符。这些是最简单粗暴的标记方式,脚本能 100% 去除。
统计水印破坏:通过 Agent 改写文本,破坏 token 采样层面的统计模式。覆盖 Claude、Google SynthID-Text、OpenAI 溯源标记、以及开源模型常用的 Kirchenbauer 类水印。
文件元数据清除:去除 PNG、JPEG、WebP、SVG、PDF、DOCX、ODT、HTML、Markdown 中的 C2PA / EXIF / XMP 元数据。
水印去除可以覆盖 Claude、Gemini、OpenAI 三大主流厂商的 AI 服务。一个有趣的细节是:项目曾经叫 remove-claude-marks,后来改名为现在的 watermarks-remover。
参考资料:https://www.bleepingcomputer.com/news/artificial-intelligence/how-anthropic-plans-to-watermark-claudes-ai-generated-text/
声明:本文来自安全内参,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。