在很多人眼中,让多个大语言模型(LLM)裁判对同一判断进行投票,只要它们达成一致,就能提高结论的可信度。但 arXiv 上的一篇新论文指出,这种推理隐含着一个关键假设:不同裁判的错误彼此独立。现实中,LLM 裁判往往以相似方式训练和评估,因此可能犯下相同的错误。论文《Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus》由 Elias Hossain 等三位作者完成,提交于 2026 年 9 月 18 日,属于 cs.AI 领域,编号 arXiv:2609.22512。
研究系统考察了裁判间误差相关对共识可靠性的影响。作者在开放权重模型和前沿模型上都发现了明显的误差相关性。在其主要使用的十名裁判组合中,裁判误差之间的平均两两相关系数为 0.21。这意味着,这十名裁判提供的信息量大约只相当于 3.5 名相互独立的裁判。换句话说,表面上的多数票或一致意见,并没有人们通常以为的那么有统计说服力。
更值得警惕的是,这种依赖在高准确率的前沿裁判中甚至更强,即使这些裁判来自不同提供商。作者指出,在某些比较中,忽略共享误差会让实验得出某个系统显著更优的结论;而一旦把共享误差纳入考虑,这种显著性就消失了。这样的误判在最多 28% 的比较中出现。
论文还强调,误差的分布模式同样重要。如果错误被大多数裁判共同犯下,和错误集中在少数裁判身上,对共识的影响并不一样,也会让不同的投票方法表现各异。因此,仅测量总体相关程度并不足以判断共识是否可靠。
基于这些发现,作者建议采用一种更务实的流程:先用一小批可信样本估计裁判准确率,并识别它们共同犯下的错误;在分析结果时把这些共享错误考虑进去;在把某种投票方法用于新数据之前,先用可信样本选择合适的方法。论文的 DOI 为 10.48550/arXiv.2609.22512,目前注册待定。