2026年9月18日にarXivへ投稿された論文「The Wisdom of Artificial Deliberative Crowds(人工的な審議を行う群衆の知恵)」(arXiv:2609.22497、cs.AI)は、大規模言語モデル同士が互いに議論したとき、人間で知られる「群衆の知恵」を再現あるいは超えられるかを検討している。著者はFederico Barrera-Lemarchand氏ら3名。
群衆の知恵とは、多くの素人の推定値を集約すると、専門家個人の判断を上回ることが多い現象を指す。これは通常、推定値が互いに独立していることに起因するとされる。しかし人間を対象とした先行研究では、審議を通じてさらに強い効果が生じることが示されている。小規模な討論グループの合意推定を平均すると、古典的な群衆の知恵を上回り、討論後の個人判断そのものも精度が上がる。この改善が、互いに審議する大規模言語モデルにも当てはまるかは不明だった。
研究チームは、人間の参加者で用いられた三段的な審議パラダイムを、3つの異なるモデルファミリーに属する大規模言語モデル向けに調整し、現実世界でのリスクが段階的に高くなる4領域で検証した。視覚的な数値推定(研究1)、機械学習論文の査読(研究2)、AIエージェントによる隠れた悪意ある行動の検出(研究3)、実際の予測市場と比較するスポーツ予測(研究4)である。
結果として、いずれの領域でも、審議は独立した回答を受動的に集約する場合よりも集団誤差を減らした。さらに審議後の個々の判断も、この集団的な利得を保持していた。注目すべきは、この優位性にはモデルの多様性が必要だという点である。単一モデルのクローンで構成されたグループは、審議による恩恵を受けなかった。著者らは、機械による審議を汎用的な集約メカニズムとして位置づけ、多様性を有効成分だと指摘している。
この知見の意味は大きい。多モデルによる審議を、単なるプロンプト技法ではなく、タスクをまたいで移行可能な集約手法へと引き上げると同時に、実務家への警告にもなっている。同じモデルに自己反復させるだけでは追加の利得は得られにくく、異なるモデル間の差異と衝突こそが利得をもたらすからだ。