跳到主要内容
AI News HubLIVE
站内改写3 分钟阅读

Claude 文本水印技术原理解析

文章摘要

Anthropic 宣布,未来 Claude 模型生成的文本将包含水印,以符合欧盟《人工智能法案》。该水印技术不会影响文本质量、可读性或成本,读者无法察觉差异,也不包含任何可追踪的个人或组织信息。文章详细解释了水印的工作原理、局限性、对代码和编辑场景的影响,以及检测 API 等内容。

Claude 文本水印技术原理解析
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

Anthropic 宣布,未来版本的 Claude 模型将在生成的文本中嵌入水印,以帮助识别内容是否由 Claude 生成。这一变化是为了遵守欧盟《人工智能法案》,该法案自 2026 年 8 月起要求 AI 提供商标记 AI 生成的内容。Anthropic 表示,水印技术不会影响文本质量,不会增加使用成本,读者也完全无法察觉差异。

水印的原理基于语言模型生成文本时的随机选择机制。例如,在“今天的天气寒冷而……”这个句子中,下一个词是“阴天”还是“灰色”都是合理的选择,模型通常会在这种低风险情境下依靠随机数决定。水印方法改变了随机数的来源:不再使用任意随机数生成器,而是使用一个密钥以及前面的几个词来做出选择。这样一来,模型选出的词仍然是随机的,但持有密钥的人可以检查文本序列是否与密钥生成模式一致,从而判断文本是否出自 Claude。

这种技术不会迫使模型选择它本来不会考虑的词。例如,它不会让 Claude 使用“nubilous”这样生僻的同义词。水印也不会在文本中添加额外内容或隐藏字符,不会产生额外 token,因此模型速度和服务成本都不受影响。

在内部测试中,Anthropic 没有发现水印对文本内容、创意性或可读性有任何影响。Google DeepMind 在 SynthID-Text 论文中提到,他们在一部分 Gemini 流量中启用水印,用户点赞和点踩没有统计学显著差异;人工评测者也看不出水印版本和普通版本的质量差别。

一个有用的比喻是玩大富翁游戏:玩家通常掷骰子决定移动步数,但如果改用圆周率数字序列来产生随机数,每个玩家的行动仍然是随机的,游戏结果也不会改变。只不过,如果事后能看到所有移动步骤并知道这个规则,就可以判断这局游戏是否使用了圆周率。Claude 的水印也是同理,读者体验不变,但事后可以验证文本是否很可能由 Claude 生成。

Claude 的文本水印是 Google DeepMind 在 2024 年 Nature 论文中提出的 SynthID-Text 方法的一个版本,该方法源于 Scott Aaronson 在 2022 年的提议。这类方法的设计原则相同:只改变随机词选择的来源。然而水印存在局限性,它只能回答“这段文本有多大可能是 Claude 写的?”,无法确认文本是否由人类撰写,也无法判断是不是另一个 AI 写的——即使其他 AI 也使用水印,它们会有不同的密钥。短文或词选择空间较小的段落中,水印可靠性较低;随着文本长度增加,判断的置信度也会提高。

在事实性很强的内容中,水印会比较稀疏。例如在“艾萨克·牛顿最著名的作品叫《自然哲学的数学原理》……”这句话后面,下一个词只能接“(Mathematica)”,水印没有可作用的余地。同样,如果用户让 Claude 只做语法和标点润色,水印只能附着在少量修改词上,可能不足以检测。Claude 写的内容越多,可供水印发挥作用的选择就越多。

对于代码来说,由于很多地方要求精确,水印也较少。但代码中的注释或任意命名等存在选择空间的地方,水印仍然可以起作用,但对实际代码的影响可以忽略不计。

用户无需担心水印会降低速度或增加费用,它的影响可以忽略不计。水印也不会泄露任何身份信息——密钥和输出中不包含与用户、组织或对话相关的内容。Anthropic 正在全球范围内部署水印,目前还没有按地区划分的持久方案,因此会在所有地区启用,并继续评估其他方法。

为什么 Anthropic 要这样做?直接原因是为了遵守欧盟《人工智能法案》。Anthropic 与其他多家大型 AI 提供商以及约 190 个签署方在 2026 年 7 月签署了欧盟《AI 生成内容透明度实践准则》,要求 AI 系统提供商对 AI 生成文本进行“标记”。

关于其他常见问题,Anthropic 透露:文本水印检测 API 即将推出,具体实现细节仍在制定中。对于 Claude 生成的图片或 SVG 等文件,Claude 会在文件元数据中添加一个小的加密签名内容凭证,标明文件由 Claude 生成或处理,这采用行业标准 C2PA,相机和修图软件也在用。该凭证不改变文件本身,也不包含个人身份信息。

如果有人试图编辑文本去除水印,轻度编辑不会完全移除,但完全重写会去掉水印——不过这种文本还能否算作 AI 生成,本身是个值得讨论的问题。水印只能说明 Claude 可能参与了内容创作,无法区分“Claude 写了全文”和“Claude 深度编辑过”。Claude 翻译的内容也包含水印,因为每个词都由 Claude 选择。欧盟法律为 2026 年 8 月 2 日之前发布的 Anthropic 模型设置了过渡期,Anthropic 正在为这些旧模型逐步添加水印,预计未来几个月内完成。

与传统 AI 检测软件(如 Pangram)不同,水印检测使用 Anthropic 持有的密钥,因此原理上更可靠;而检测软件无法访问密钥,只能依赖统计特征等方法。

展开要点与分析

文章情报

工程师进阶

要点

  • Claude 未来模型将使用基于 SynthID-Text 的水印技术,通过改变低风险词选择的随机来源来标记内容,不影响输出质量。
  • 水印对读者完全不可见,不添加隐藏字符,不增加 token 或费用,也无法追溯到具体用户或组织。
  • 水印仅提供 Claude 参与生成的概率判断,在短文本、事实性内容或轻度编辑场景中可能无法可靠检测。
  • 除文本外,Claude 生成的文件将使用 C2PA 内容凭证;文本水印检测 API 即将推出。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。