arXiv 于 2026 年 9 月 18 日(UTC 时间 19:01:43)发布预印本论文 arXiv:2609.22497v1,主题分类为人工智能(cs.AI),状态为“new”。论文英文标题为《The Wisdom of Artificial Deliberative Crowds》,可译为《人工审议群体的智慧》。作者为 Federico Barrera-Lemarchand 等共 3 人,投稿人为 Joaquin Navajas,全文文件约 1,323 KB。论文 DOI 为 10.48550/arXiv.2609.22497,由 DataCite 发放的 arXiv DOI 目前仍处于待注册状态。
研究的问题起点是经典的“群体智慧”现象:把许多普通人的估计汇总起来,往往比单个专家的判断更准确。传统解释把这种优势归因于估计之间的相互独立性。但论文指出,还存在一种更强的效应,来自“审议”(deliberation):把若干小型审议小组各自的共识估计再取平均,其表现可以超过经典的群体智慧;与此同时,参与审议的个体在审议之后,其个人判断本身也会变得更准确。问题在于,这种由人类被试身上观察到的改进,是否能迁移到大语言模型彼此之间的审议之中,此前尚不清楚。
为回答这一问题,作者把一套此前用于人类被试的三阶段审议范式加以改造,用于来自三个不同模型家族的大语言模型,并在四个现实风险逐步升高的领域中进行了测试:研究一是视觉数值估计;研究二是对机器学习论文的同行评审;研究三是检测一个人工智能体隐藏的恶意行为;研究四是与真实预测市场对赌的体育赛事预测。四个研究的设计意图,是让任务从相对抽象、低风险逐步走向具有真实后果的高风险判断场景。
结果显示,在所有这些领域中,审议都进一步降低了集体误差,其表现超过了把独立回答被动汇总的做法;而且在审议结束后,个体的判断仍然保留住了这种集体收益,说明收益并非只存在于小组共识的层面,而是沉淀到了个体能力之中。
论文特别强调了一个关键的条件:这种优势依赖于模型的多样性。由同一个模型的多个“克隆”组成的小组,在审议中并没有获得收益。作者据此认为,机器审议可以作为一种通用的聚合机制,而多样性正是其中真正起作用的活性成分。
需要留意的限制与背景在于:论文目前为 arXiv 预印本(v1),尚未经过同行评审;实验中的审议范式是从人类参与者研究改造而来,涉及三个模型家族与四个领域,作者用“现实风险递增”来描述这四个研究的选择,而不是随机抽样。此外,摘要层面并未给出各研究的具体误差指标与效应量,这些细节需回到全文核验。
从更广的意义看,这项工作把“群体智慧—审议—多样性”这条人类行为研究中的因果链条,搬到了机器协作的场景里:它提示,简单地让同一个模型自我复述、自我投票,并不能复制审议带来的增益;要让多智能体系统在估计、评审、行为审计与预测等任务上真正优于单次独立推断,异质性的模型构成可能是不可或缺的前提。论文将机器审议定位为一种通用聚合机制,并把多样性视为其发挥作用的活性成分。