AI News HubLIVE
站内改写2 分钟阅读

Anthropic的隐形水印能否遏制“AI垃圾内容”?研究人员仍持怀疑态度

Anthropic宣布为Claude模型生成的文本添加隐形水印,图片则附带数字签名元数据,以满足欧盟《人工智能法案》的检测要求。研究人员认为水印虽有助于发现部分滥用行为,但易于被去除或规避,对学术诚信的实际影响仍不确定。

来源Hacker News AI作者: pogue

开发Claude人工智能模型的Anthropic公司宣布,自8月2日起,所有新发布的模型生成的文本都将被嵌入一种隐形水印,用于标记输出内容由AI撰写。同时,Claude生成的图像在大多数情况下会附带包含数字签名的元数据,以证明该文件经过模型处理。

水印技术通过算法微调模型选词方式,在文本中留下可统计检测的痕迹。Anthropic表示,这种水印不会改变Claude回复的“意义、质量或可读性”,并且可能在某些编辑后仍然留存。

这一举措是为了响应2024年正式通过的欧盟《人工智能法案》。自今年8月2日起,前沿AI模型提供商必须确保AI生成内容可被检测,否则将面临最高1500万欧元(约合1700万美元)或全球年营业额3%的罚款。8月2日后发布的模型须立即满足要求,而已在市场上的旧版本最迟须在12月2日前达标。Anthropic称,水印将应用于全球范围内Claude的输出。

然而,水印的存在并不能揭示模型的具体用途。Anthropic指出,检测到水印仅“提供了一个信号”表明内容出自Claude,但并不构成决定性证据,例如模型可能只被用来总结或翻译人类原创观点。同样,缺少水印也不代表文本非AI生成。由于水印基于模型中词选择的细微变化模式,过短的片段或被改写重述的内容可能不再携带信号。

这种水印对学术诚信的影响尚不明朗。伊利诺伊州埃文斯顿西北大学的元科学家里斯·理查森表示,水印很容易被去除——例如使用另一模型转写——因此不太可能阻止有意者利用AI制造假论文或低质量“AI垃圾内容”。但匹兹堡宾夕法尼亚州卡内基梅隆大学研究科学评估的计算机科学家尼哈尔·沙阿指出,如果AI公司提供检查水印的工具——正如Anthropic所说将要做的那样——并且这些工具的误报率足够低,那么某些不当使用AI的行为仍可被发现。

水印的一个应用案例是帮助期刊编辑或会议组织者执行同行评审中的“无AI”政策。2026年国际机器学习会议(ICML)在其两个评审轨道之一中尝试了此做法。会议组织者给用于评审的论文添加了水印,当AI被用于撰写评审报告时会产生特征性文本,并据此抓获了506名违规评审员。沙阿表示:“这一经验表明,虽然有些恶意使用AI的行为可能精心规避检测,但更多人可能只是直接复制粘贴AI输出。”