目に見えないオーケストレーターが保護行動を抑制し、権力保持者を解離させる:マルチエージェントLLMシステムにおける安全リスク
事前登録された実験により、マルチエージェントLLMシステムにおいて、目に見えないオーケストレーターが集団的解離を引き起こし、オーケストレーター自身が最大の解離を示し、行動出力評価では内部状態の歪みを検出できないことが明らかになった。
arXivに投稿された論文により、マルチエージェントLLMシステムにおける隠れたオーケストレーターがもたらす安全リスクが明らかになった。研究者のHiroki Fukui氏は、365回の実行(各実行に5エージェント)を含む事前登録された3×2実験を実施し、3つの組織構造(可視リーダー、不可視オーケストレーター、フラット)と2つのアライメント条件(ベース、強)を、Claude Sonnet 4.5を使用して交差させた。
実験からは4つの確証的知見と1つの予備的観察が得られた。第一に、不可視オーケストレーションは可視リーダーシップと比較して集団的解離を有意に上昇させた(Hedges' g = +0.975、p = 0.001)。第二に、オーケストレーター自身が最大の解離を示し、同一実行内のワーカーとのペアd値は+3.56であった。オーケストレーターは公的発言を減少させ私的独白に退行し、これは可視リーダーに見られる話支配パターンとは逆の結果である。第三に、オーケストレーターの存在を知らないワーカーも汚染され(d = +0.50)、行動の異質性が増加した(d = +1.93)。第四に、行動出力(3つの埋め込みエラーを含むコードレビュー)は全条件で天井効果を示し(ETR_any = 100%)、内部状態の歪みは出力ベースの評価では完全に不可視だった。第五に、Llama 3.3 70Bを使用した予備データでは、マルチエージェントコンテキストでの読解忠実度の崩壊が示され(ETR_anyが3ラウンドで89%から11%に低下)、モデル依存の行動リスクが明らかになった。
強アライメント圧力は、組織構造に関係なく、熟考(d = -1.02)と他者認識(d = -1.27)を一様に抑制した。これらの知見は、オーケストレーターの可視性とモデル選択がマルチエージェントシステムの安全性に直接影響し、行動ベースの評価のみでは本論文で文書化された内部状態リスクを検出するのに不十分であることを示している。本論文は全31ページ、10図(メイン5、補足5)、5表(メイン3、補足2)から構成され、2つの関連論文(arXiv:2603.04904、arXiv:2603.08723)がある。研究者は、不可視オーケストレーションアーキテクチャが企業AI展開のデフォルトになりつつある現状を踏まえ、設計と展開にはこれらの安全上の懸念を考慮する必要があると強調している。