在很多人眼中,讓多個大語言模型(LLM)裁判對同一判斷進行投票,只要它們達成一致,就能提高結論的可信度。但 arXiv 上的一篇新論文指出,這種推理隱含著一個關鍵假設:不同裁判的錯誤彼此獨立。現實中,LLM 裁判往往以相似方式訓練和評估,因此可能犯下相同的錯誤。論文《Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus》由 Elias Hossain 等三位作者完成,提交於 2026 年 9 月 18 日,屬於 cs.AI 領域,編號 arXiv:2609.22512。
研究系統考察了裁判間誤差相關對共識可靠性的影響。作者在開放權重模型和前沿模型上都發現了明顯的誤差相關性。在其主要使用的十名裁判組合中,裁判誤差之間的平均兩兩相關係數為 0.21。這意味著,這十名裁判提供的資訊量大約只相當於 3.5 名相互獨立的裁判。換句話說,表面上的多數票或一致意見,並沒有人們通常以為的那麼有統計說服力。
更值得警惕的是,這種依賴在高準確率的前沿裁判中甚至更強,即使這些裁判來自不同提供商。作者指出,在某些比較中,忽略共享誤差會讓實驗得出某個系統顯著更優的結論;而一旦把共享誤差納入考慮,這種顯著性就消失了。這樣的誤判在最多 28% 的比較中出現。
論文還強調,誤差的分佈模式同樣重要。如果錯誤被大多數裁判共同犯下,和錯誤集中在少數裁判身上,對共識的影響並不一樣,也會讓不同的投票方法表現各異。因此,僅測量總體相關程度並不足以判斷共識是否可靠。
基於這些發現,作者建議採用一種更務實的流程:先用一小批可信樣本估計裁判準確率,並識別它們共同犯下的錯誤;在分析結果時把這些共享錯誤考慮進去;在把某種投票方法用於新資料之前,先用可信樣本選擇合適的方法。論文的 DOI 為 10.48550/arXiv.2609.22512,目前註冊待定。