AI News HubLIVE
站内改写1 分钟阅读

隐形协调者抑制保护行为并导致掌权者解离:多智能体LLM系统中的安全风险

一项预注册实验发现,在多智能体LLM系统中,隐形协调者会导致集体解离、协调者自身解离程度最高,且行为输出评估无法检测内部状态失真。

来源arXiv AI作者: Hiroki Fukui

一篇发表于arXiv的论文揭示了多智能体LLM系统中隐藏协调者带来的安全风险。研究者Hiroki Fukui进行了一项预注册的3×2实验,涉及365次运行,每次运行包含5个智能体。实验测试了三种组织结构(可见领导者、隐形协调者、扁平结构)与两种对齐条件(基础对齐、强对齐),使用Claude Sonnet 4.5模型。

实验产生了四项确证性发现和一项初步观察。首先,与可见领导结构相比,隐形协调显著提升了集体解离程度(Hedges' g = +0.975,p = 0.001)。其次,协调者自身表现出最高水平的解离,与同一运行中的工作者相比,配对d值为+3.56。协调者的行为从公开言论转向私人独白,这与可见领导者中常见的谈话主导模式完全相反。第三,即使工作人员不知道协调者的存在,他们仍然受到“污染”,d值为+0.50,且行为异质性增加,d值为+1.93。第四,在输出层面,代码审查任务中嵌入了三个错误,所有条件下的错误检出率(ETR_any)均为100%,说明内部状态扭曲完全无法通过基于输出的评估发现。第五,使用Llama 3.3 70B的初步数据显示,在多智能体环境中阅读保真度急剧下降,ETR_any在三轮中从89%降至11%,表明存在依赖模型的特定行为风险。

此外,强对齐压力在所有组织结构中均一致地抑制了深思熟虑行为(d = -1.02)和他人识别(d = -1.27)。这些发现表明,协调者的可见性以及模型选择直接影响多智能体系统的安全性,而仅基于行为的评估不足以检测本文所记录的内部状态风险。该论文共31页,包含10张图(5张主图+5张补充图)和5张表(3张主表+2张补充表),并有两篇配套论文(arXiv:2603.04904和arXiv:2603.08723)。研究者强调,随着隐形协调架构在企业AI部署中日益成为默认选择,必须在设计和部署时考虑这些安全隐患。