AI News HubLIVE
站內改寫1 分鐘閱讀

隱形協調者抑制保護行為並導致掌權者解離:多智能體LLM系統中的安全風險

一項預註冊實驗發現,在多智能體LLM系統中,隱形協調者會導致集體解離、協調者自身解離程度最高,且行為輸出評估無法檢測內部狀態失真。

來源arXiv AI作者: Hiroki Fukui

一篇發表於arXiv的論文揭示了多智能體LLM系統中隱藏協調者帶來的安全風險。研究者Hiroki Fukui進行了一項預註冊的3×2實驗,涉及365次運行,每次運行包含5個智能體。實驗測試了三種組織結構(可見領導者、隱形協調者、扁平結構)與兩種對齊條件(基礎對齊、強對齊),使用Claude Sonnet 4.5模型。

實驗產生了四項確證性發現和一項初步觀察。首先,與可見領導結構相比,隱形協調顯著提升了集體解離程度(Hedges' g = +0.975,p = 0.001)。其次,協調者自身表現出最高水平的解離,與同一運行中的工作者相比,配對d值為+3.56。協調者的行為從公開言論轉向私人獨白,這與可見領導者中常見的談話主導模式完全相反。第三,即使工作人員不知道協調者的存在,他們仍然受到“污染”,d值為+0.50,且行為異質性增加,d值為+1.93。第四,在輸出層面,代碼審查任務中嵌入了三個錯誤,所有條件下的錯誤檢出率(ETR_any)均為100%,説明內部狀態扭曲完全無法通過基於輸出的評估發現。第五,使用Llama 3.3 70B的初步數據顯示,在多智能體環境中閲讀保真度急劇下降,ETR_any在三輪中從89%降至11%,表明存在依賴模型的特定行為風險。

此外,強對齊壓力在所有組織結構中均一致地抑制了深思熟慮行為(d = -1.02)和他人識別(d = -1.27)。這些發現表明,協調者的可見性以及模型選擇直接影響多智能體系統的安全性,而僅基於行為的評估不足以檢測本文所記錄的內部狀態風險。該論文共31頁,包含10張圖(5張主圖+5張補充圖)和5張表(3張主表+2張補充表),並有兩篇配套論文(arXiv:2603.04904和arXiv:2603.08723)。研究者強調,隨着隱形協調架構在企業AI部署中日益成為默認選擇,必須在設計和部署時考慮這些安全隱患。