认知Sybil抗性:增加更多AI智能体不等于获得更多证据
一项研究将多智能体系统把共享同一证据链的报告误当作独立观察的问题形式化为“认知Sybil问题”。通过20,000余次受控LLM智能体实验,作者证明报告数量翻倍会严重破坏朴素推断的校准,且单纯基于文本相似性的去重难以还原真实证据谱系;集体推断应追踪证据来源和依赖关系。
多智能体系统的常见设想是:派出更多AI智能体,让它们各自阅读证据并生成报告,再对报告做综合,就能提升推理可靠性。但新近提交至arXiv的一篇论文(编号2609.01873,作者 Marc Bara,2026年9月1日)提醒,这个设想混淆了“智能体数量”与“观察次数”。表面上相互独立的报告可能源自同一份证据;反之,真正独立的证据也可能让不同智能体给出几乎相同的文本。论文把这种将重复派生误认为独立佐证的问题称为“认知Sybil问题”。
作者给出了形式定义:若在已有报告集合 R 的条件下,新报告 Z 关于目标变量 Θ 的条件互信息 I(Θ; Z | R)=0,则 Z 是一个“认知Sybil扩展”。论文证明,只依赖报告内容的聚合器原则上无法区分“复制同一证据”和“独立佐证同一结论”;同样一句表述在未观测的谱系关系不同的情形下,可能对应完全不同的后验。借助高斯共享根模型,论文还表明共同祖先并不等于完全冗余,重复提取能向“源级上限”逼近;但若独立智能体共享同一个基础模型,提取错误会彼此相关,而这个相关性会进一步压低上限。
为验证理论,研究者在合成证据文档上进行了超过2万次受控LLM智能体报告与提取调用。实验发现,固定单一证据根而把报告数从1提升到32,朴素后验覆盖率会从0.940跌至0.263——即报告越多,系统反而显得过度自信。反过来,固定报告总数而把证据根数从1增至16,能逐步填补该缺口,且当 k=16 时不同聚合器的表现统计上无法区分。独立智能体重复提取的错误也确实相关(样本外估计 gamma_cal=0.719),而显式建模相关提取错误的聚合器能够恢复校准。
论文还通过受控操作把“表征相似性”与“证据谱系”分开:仅改变表征相似性会使报告空间中去重机制推断出的平均簇数变化1.425(95% CI [1.363, 1.485]),而真实谱系发生四倍变化时,该指标只变化0.040(95% CI [-0.045, 0.120])。这个强烈不对称说明,在报告空间中做文本去重很容易被表达方式牵着走。结论因此很直接:集体推断应追踪证据祖先与依赖结构,而不是追踪智能体或报告的数量,也不应依赖报告文本的相似度。论文共23页、13幅图,并公开了代码与数据。