AI News HubLIVE
站内改写1 分钟阅读

AI水印证据未能满足取证准备性:一项实证评估

一项新研究评估了三种LLM水印方法(KGW、Unigram、SynthID-Text)的取证可靠性,发现它们都无法满足法庭证据标准。在846次释义攻击中,KGW和Unigram水印被100%移除,SynthID移除率达98.3%。此外,三种方法的假阴性率高达70-83%,且SynthID将5.4%的人类写作文本误判为AI生成。研究者提出了取证准备性评分(FRS)框架,但结论是这些水印配置不能提供法庭可接受的证据。

来源Hacker News AI作者: sbulaev

随着欧盟《人工智能法案》和加利福尼亚州SB 942等法规要求大型语言模型(LLM)生成的内容必须带有水印,一项新的实证研究对这些水印方法的取证可靠性提出了严重质疑。该研究由Saifur Rahman Tamim和Amir Labib Khan进行,评估了三种代表性水印技术——KGW、Unigram以及MarkLLM实现的SynthID-Text——是否符合Daubert证据可采性标准和NIST SP 800-86数字取证流程。

为了进行系统评估,研究者提出了一个包含12项标准、三个强制门槛和60分评分系统的取证准备性评分(FRS)框架。他们选择保留语义的释义作为攻击向量,因为这在法律上具有现实性,且难以被视为证据篡改。实验使用15个不同提示对每种方法进行了846次有效释义测试。

结果令人震惊:所有最初检测到水印的KGW和Unigram文本在释义后完全丢失了水印——即100%的条件移除率。SynthID仅略好,为98.3%。即使在未受攻击的情况下,假阴性率也高得惊人:KGW为70%,Unigram为83%,SynthID为80%。此外,SynthID配置将5.4%的释义人类写作文本误判为AI生成,并表现出18.6%的悖论率——其80%的原始水印输出落入不确定性死区。这意味着在正常使用中,大多数带水印的输出也无法被可靠检测。

在Daubert因素的评估中,三种方法没有一种能满足五个因素中的两个以上。研究还发现,尽管FRS评分系统按设计运行,但它无法完全捕捉取证上的无用性——这对未来框架设计是一个值得注意的局限性。例如,即使方法在某些项目上得分,整体上仍可能无法用于法庭。

论文作者总结道,这些经测试的配置无法达到法庭要求的证据标准。他们强调,监管机构在强制推行水印之前,必须确保底层技术具备真正的取证可靠性。该研究已提交至2026年AAAI/ACM人工智能、伦理与社会会议(AIES),并将在9页论文中展示4张图表,详细说明实验设计和结果。