arXiv 於 2026 年 9 月 18 日(UTC 時間 19:01:43)發佈預印本論文 arXiv:2609.22497v1,主題分類為人工智能(cs.AI),狀態為“new”。論文英文標題為《The Wisdom of Artificial Deliberative Crowds》,可譯為《人工審議羣體的智慧》。作者為 Federico Barrera-Lemarchand 等共 3 人,投稿人為 Joaquin Navajas,全文文件約 1,323 KB。論文 DOI 為 10.48550/arXiv.2609.22497,由 DataCite 發放的 arXiv DOI 目前仍處於待註冊狀態。
研究的問題起點是經典的“羣體智慧”現象:把許多普通人的估計彙總起來,往往比單個專家的判斷更準確。傳統解釋把這種優勢歸因於估計之間的相互獨立性。但論文指出,還存在一種更強的效應,來自“審議”(deliberation):把若干小型審議小組各自的共識估計再取平均,其表現可以超過經典的羣體智慧;與此同時,參與審議的個體在審議之後,其個人判斷本身也會變得更準確。問題在於,這種由人類被試身上觀察到的改進,是否能遷移到大語言模型彼此之間的審議之中,此前尚不清楚。
為回答這一問題,作者把一套此前用於人類被試的三階段審議範式加以改造,用於來自三個不同模型家族的大語言模型,並在四個現實風險逐步升高的領域中進行了測試:研究一是視覺數值估計;研究二是對機器學習論文的同行評審;研究三是檢測一個人工智能體隱藏的惡意行為;研究四是與真實預測市場對賭的體育賽事預測。四個研究的設計意圖,是讓任務從相對抽象、低風險逐步走向具有真實後果的高風險判斷場景。
結果顯示,在所有這些領域中,審議都進一步降低了集體誤差,其表現超過了把獨立回答被動彙總的做法;而且在審議結束後,個體的判斷仍然保留住了這種集體收益,説明收益並非只存在於小組共識的層面,而是沉澱到了個體能力之中。
論文特別強調了一個關鍵的條件:這種優勢依賴於模型的多樣性。由同一個模型的多個“克隆”組成的小組,在審議中並沒有獲得收益。作者據此認為,機器審議可以作為一種通用的聚合機制,而多樣性正是其中真正起作用的活性成分。
需要留意的限制與背景在於:論文目前為 arXiv 預印本(v1),尚未經過同行評審;實驗中的審議範式是從人類參與者研究改造而來,涉及三個模型家族與四個領域,作者用“現實風險遞增”來描述這四個研究的選擇,而不是隨機抽樣。此外,摘要層面並未給出各研究的具體誤差指標與效應量,這些細節需回到全文核驗。
從更廣的意義看,這項工作把“羣體智慧—審議—多樣性”這條人類行為研究中的因果鏈條,搬到了機器協作的場景裏:它提示,簡單地讓同一個模型自我複述、自我投票,並不能複製審議帶來的增益;要讓多智能體系統在估計、評審、行為審計與預測等任務上真正優於單次獨立推斷,異質性的模型構成可能是不可或缺的前提。論文將機器審議定位為一種通用聚合機制,並把多樣性視為其發揮作用的活性成分。