Claude 文本水印机制如何运作
How Claude’s text watermark works
未来 Claude 模型生成的文本将包含水印,用于判断文本由 Claude 撰写的可能性,这是 Anthropic 为遵守欧盟《AI 法案》而实施的变更。该方法基于 Google DeepMind 的 SynthID-Text 技术,对输出质量、创造力和可读性无实际影响,读者无法区分水印文本与普通文本,且不增加额外 token 或成本。
SynthID-Text 只改变等概率候选词的随机来源,不影响生成质量,却能用密钥校验文本与 Claude 的关联概率,为内容溯源提供了一种非侵入式检测思路。
未来的 Claude 模型生成的文本将包含水印。这是一种判断文本由 Claude 参与撰写的可能性的方法。我们以及其他几家主要 AI 提供商正在实施这一变更,以符合欧盟《人工智能法案》的要求。
在本文中,我们分享了一些关于我们所选水印方法如何运作、是否会影响 Claude 的输出,以及我们为何做出这一变更等问题的解答。概括如下:
- 我们采用的水印方法对 Claude 输出的质量或内容没有任何实际影响;
- 读者无法分辨带水印与不带水印文本之间的差异;
- 文本中不会添加任何内容,也不包含隐藏字符;
- 水印不需要额外的模型 token,也不会增加成本;
- 水印不携带任何身份识别信息,无法追溯到特定个人、组织或对话;
- 水印并非 Claude 独有。自 8 月 2 日起,欧盟要求服务其市场的 AI 提供商对 AI 生成的内容进行标记。其他主要模型开发商也已签署同一份《行为准则》,并将实施各自的水印方案。
什么是水印?
像 Claude 这样的大语言模型,其工作方式是逐词生成文本。每次模型决定下一个词时,都会从一组候选词中挑选,最终根据前文选择最合理或最有可能的那个词。以“今天的天气寒冷且……”这句话为例,下一个词几乎不可能是“甜腻的”,但很可能是“阴沉的”或“灰蒙蒙的”。在大多数情况下,模型最终选择这两个词中的哪一个,对读者来说差别不大——无论选哪个,句子的含义大体相同。在这种情况下,选择便由随机数来决定。
水印技术正是利用这类低风险选择——在生成文本中会出现许多次——在 Claude 的回复中留下一种模式。这种模式对读者来说无法察觉,但任何持有编码密钥的人都可以检测到它。使用水印时,选择仍然是随机做出的,但随机性的来源有所不同。水印技术不是使用任意的随机数生成器来挑选下一个词,而是使用密钥和前面的几个词来决定模型应该选择哪个词。也就是说,Claude 选择的词仍然是随机的,但现在,人们可以检查词的序列,看它是否与 Claude 在使用密钥时会做出的选择一致。如果一致,就可以计算出该文本由 Claude 生成的概率。
重要的是,这并不意味着模型现在会总是偏向于“阴天”或“灰色”这类词。正如无水印文本一样,某个句子可能选择“阴天”,下一句可能选择“灰色”,具体取决于前面的词语。而且,水印方法并不会促使 Claude 去选择一个它本来不会考虑的词(例如,它不会让 Claude 选“nubilous”这种词——这是“阴天”或“灰色”的一个生僻1同义词,Claude 在正常情况下几乎肯定不会使用)。
水印如何影响 Claude 的输出?
水印不会影响 Claude 输出的质量。对读者而言,带水印的回复与不带水印的回复无法区分(从这个意义上说,AI 水印与纸币、其他实体物品以及某些数字文档上的同名水印有很大不同,后者是肉眼可见的)。
在内部测试中,我们没有发现水印对 Claude 文本的内容、创意水平或可读性产生任何影响。在介绍我们所采用技术的SynthID-Text 论文中,Google DeepMind 通过将使用水印的模型服务于其部分 Gemini 流量,并比较点赞和点踩评分来测试这一影响。他们发现,与无水印模型相比,没有统计学上的显著差异。在一项对照研究中,人工评估者并排比较带水印和不带水印的答案,也未发现质量上的差异。
一个有用的类比是:想象你在玩大富翁之类的游戏。每轮中,每位玩家根据骰子的点数在棋盘上随机移动若干格。假设我们不用骰子来产生这种随机性,而是改用一本圆周率数字的书。2我们从随机选定的一个数字开始(比如小数点后第 1,012,845 位,恰好是 6),从那一刻起,每位玩家只需依次使用序列中的下一个数字作为自己的下一次“掷骰”。
从所有实际效果来看,这些移动仍然是随机的:无论随机性来自圆周率还是每次掷骰子,对玩家而言——或对游戏结果而言——都没有区别。但如果我们能在游戏结束后看到所有移动的序列(并且我们知道圆周率的值),我们就能判断出这局游戏是否可能使用了圆周率来决定移动。使用圆周率的那局游戏,在某种意义上就是“带水印”的。
Claude 生成的文本也是如此。水印不会改变阅读者的体验或文本含义,但如果你事后想核查某段文本是否很可能由 Claude 生成,水印就能让你做到这一点。
你们具体使用哪种水印方法?
Claude 的文本水印是 Google DeepMind 于 2024 年在 《自然》 论文 中发表的 SynthID-Text 方法的一个版本。它属于一个可追溯至 2022 年 Scott Aaronson 提议的方法家族,所有这些方法都遵循我们上文所述的相同设计原则——水印只改变用于在词语之间进行选择的随机性来源。
水印的有效性存在一些局限。使用我们的密钥,只能回答这样一个问题:“这段文字有多大的可能性是部分由 Claude 撰写的?”它无法确认文本是否由人类撰写,也无法判断文本是否由其他 AI 撰写(即使那个 AI 也使用水印,它也会有不同的密钥;它甚至可能使用完全不同的水印方法)。在样本量较小的情况下,检测水印的效果也不理想,因为可供选择的词语较少,可依据的信息也就更少。随着段落长度的增加,对 Claude 参与程度的置信度也会随之提高。
在事实性段落中,水印的分布较为稀疏,因为在不降低文本准确性的前提下,可供选择的词语较少。例如,句子“艾萨克·牛顿最著名的著作名为 《原理》……”中,下一个词是否为“《数学》”至关重要(这是唯一正确的答案),因此水印将无从着力。校对的情况也是如此。如果你把一篇文章交给 Claude,并要求它只修改语法和标点、不做其他改动,那么水印只能存在于那为数不多的几处修正中,而这些修正可能太少而无法被检测到。
那么,如果 Claude 只是校对或编辑了人类撰写的文本,这种情况又如何处理?
水印仅适用于 Claude 自己选择的词汇。当 Claude 校对人类撰写的文本时,它返回的内容通常只经过轻度编辑;由于几乎所有词汇都出自人类之手,水印几乎(甚至完全没有)可以附着的地方。具体取决于文本长度以及 Claude 编辑的幅度,这些改动可能不足以让 Claude 的参与被检测出来。Claude 写得越多,它需要做出的决策就越多,水印可嵌入的空间也就越大。
那代码呢?
正如我们上文所述,AI 水印利用的是那些两种词汇选择同样合理的决策点。当需要精确输出时——即不存在选择余地,若选用其他词汇会导致事实错误或代码无法运行时——水印便不会被应用。
例如,一旦模型写出了“2 + 2 =”,下一个 token 就存在一个非常明确的最佳选择(如果模型是在完成求和运算,没有任何答案能与“4”同样合理;如果它是在谈论乔治·奥威尔的《一九八四》,也没有任何答案能与“5”同样合理)。水印的“轻推”在这里不会被应用。出于同样的原因,代码——在很多情况下必须精确无误——相比其他形式的文本,通常被嵌入水印的程度也更低。
话虽如此,在代码中存在对特定词语或术语的任意选择时,可以使用水印,例如代码中的注释。但顾名思义,它对实际生成的代码产生的影响微乎其微。
这对用户意味着什么?
这会拖慢模型速度,或使其成本更高吗?
不会。水印对模型速度的影响微乎其微,而且由于它不会产生额外的模型 token,模型的提供和使用成本保持不变。
水印能否被追溯到我的个人或组织身份?
不能。水印应用于 Claude 及其输出内容。它不识别任何与个人用户相关的信息。水印本身或其密钥中不包含任何能让任何人恢复出用户、其组织或与 Claude 对话内容相关信息的内容。
为什么要给 Claude 的输出添加水印?
我们正在实施水印技术,以符合欧盟《人工智能法案》的要求。Anthropic 与其他几家主要 AI 模型提供商以及约 190 家签署方 一起,于 2026 年 7 月签署了欧盟《AI 生成内容透明度行为准则》。该准则要求 AI 系统提供商采用“标记”AI 生成文本的方法。我们将在发布时在全球范围内应用水印,因为目前我们还没有一种持久的方法来按地区限定其适用范围。不过,我们将继续评估不同的方法,并在有进展时分享更新。
其他问题
如何检查一段文本是否由 Claude 撰写?
我们将以私有预览形式发布一个检测 API。目前,该 API 可供符合欧盟法律要求的合格组织使用(例如监管机构、执法部门、媒体、事实核查机构、独立研究人员、教育组织以及欧盟民间社会团体)。对于同样有义务验证水印以遵守该法案的企业,该 API 也可供其使用。我们计划逐步扩大检测 API 的访问范围。您可以在此处登记访问意向。
图像和其他文件呢?
当 Claude 生成受支持类型的文件(如 .png、.jpg 或 .svg)时,它会在文件元数据中附加一条内容凭证,形式为一段经过加密签名的小型备注,说明该文件由 Claude 制作或处理。这是一项开放的行业标准,名为 C2PA——相机厂商和照片编辑软件也使用同一标准来记录图像的来源。任何支持 C2PA 的工具都能读取该凭证;我们也将提供自己的工具,让你可以拖入文件进行检查。
这种元数据标签与水印截然不同。文件本身没有任何变化——它既不是嵌入式的,也不是隐藏式的。与文本一样,该凭证仅说明 Claude 参与了文件的制作,不包含任何身份识别信息。
难道不能通过编辑文本来绕过水印吗?
在某种程度上,可以。轻度编辑可能无法完全去除水印;但如果彻底重写、替换每一个词,水印就会被去除。当然,在后一种情况下,这段文本是否还能被称为 AI 生成的内容,本身就值得商榷。
水印实际上能证明什么?
水印只能判断 Claude 很可能在某个环节参与了内容的生成。它无法区分“Claude 撰写了这段内容”和“Claude 对这段内容进行了大量编辑”。
水印适用于翻译内容吗?
是的。Claude 生成的译文带有水印,因为在这种情况下,每个词都是由 Claude 选择的。
那较旧的 Claude 模型呢?
欧盟法律为 2026 年 8 月 2 日之前推出的 Anthropic 模型设置了过渡期,我们正在努力为这些模型也添加水印功能。这项工作将在未来几个月内逐步推出。
这与 AI 检测软件(如 Pangram)有何不同?
AI 检测软件使用的方法不同,因为提供这些服务的公司没有我们的密钥。除其他方法外,这些服务会考察文本的某些方面,比如 AI 措辞中经常出现的细微(有时也不那么细微的)"破绽"。例如,AI 模型似乎偏爱"这不是 [X],而是 [Y]"这样的句式,而且使用"quietly"一词的频率远高于你的预期。捕捉这些模式与检查水印在本质上是不同的。
这会改变某个输出的所有权归属,或谁对其承担法律责任吗?
不会。水印只用于帮助检验内容是否可能由 Claude 生成或处理。它不涉及所有权或作者身份的任何信息,也不会改变用户在我们条款下的权利。只有当 Claude 参与了内容或文件的处理时,我们才会应用水印。
更新于 2026 年 9 月 1 日:提供了关于水印检测 API 的最新信息。
脚注
- 或者,你也可以说 nubilous——这个词同样是“晦涩难懂”的同义词。
- 圆周率在技术上是可预测的,但从圆周率中间某处截取的任意一串数字,与掷十面骰子得到的一串结果无法区分。另外,暂且不论《大富翁》中的骰子点数范围是 1 到 6,而圆周率的每一位数字可以是 0 到 9——这个类比并不完美。
来源:Anthropic:Newsroom(网页) · anthropic.com