認知Sybil抗性:增加更多AI智慧體不等於獲得更多證據
一項研究將多智慧體系統把共享同一證據鏈的報告誤當作獨立觀察的問題形式化為“認知Sybil問題”。透過20,000餘次受控LLM智慧體實驗,作者證明報告數量翻倍會嚴重破壞樸素推斷的校準,且單純基於文本相似性的去重難以還原真實證據譜系;集體推斷應追蹤證據來源和依賴關係。
多智慧體系統的常見設想是:派出更多AI智慧體,讓它們各自閱讀證據並生成報告,再對報告做綜合,就能提升推理可靠性。但新近提交至arXiv的一篇論文(編號2609.01873,作者 Marc Bara,2026年9月1日)提醒,這個設想混淆了“智慧體數量”與“觀察次數”。表面上相互獨立的報告可能源自同一份證據;反之,真正獨立的證據也可能讓不同智慧體給出幾乎相同的文本。論文把這種將重複派生誤認為獨立佐證的問題稱為“認知Sybil問題”。
作者給出了形式定義:若在已有報告集合 R 的條件下,新報告 Z 關於目標變數 Θ 的條件互資訊 I(Θ; Z | R)=0,則 Z 是一個“認知Sybil擴充套件”。論文證明,只依賴報告內容的聚合器原則上無法區分“複製同一證據”和“獨立佐證同一結論”;同樣一句表述在未觀測的譜系關係不同的情形下,可能對應完全不同的後驗。藉助高斯共享根模型,論文還表明共同祖先並不等於完全冗餘,重複提取能向“源級上限”逼近;但若獨立智慧體共享同一個基礎模型,提取錯誤會彼此相關,而這個相關性會進一步壓低上限。
為驗證理論,研究者在合成證據文件上進行了超過2萬次受控LLM智慧體報告與提取呼叫。實驗發現,固定單一證據根而把報告數從1提升到32,樸素後驗覆蓋率會從0.940跌至0.263——即報告越多,系統反而顯得過度自信。反過來,固定報告總數而把證據根數從1增至16,能逐步填補該缺口,且當 k=16 時不同聚合器的表現統計上無法區分。獨立智慧體重複提取的錯誤也確實相關(樣本外估計 gamma_cal=0.719),而顯式建模相關提取錯誤的聚合器能夠恢復校準。
論文還透過受控操作把“表徵相似性”與“證據譜系”分開:僅改變表徵相似性會使報告空間中去重機制推斷出的平均簇數變化1.425(95% CI [1.363, 1.485]),而真實譜系發生四倍變化時,該指標只變化0.040(95% CI [-0.045, 0.120])。這個強烈不對稱說明,在報告空間中做文本去重很容易被表達方式牽著走。結論因此很直接:集體推斷應追蹤證據祖先與依賴結構,而不是追蹤智慧體或報告的數量,也不應依賴報告文本的相似度。論文共23頁、13幅圖,並公開了程式碼與資料。