AI News HubLIVE
サイト内リライト2 分で読了

OpenEvoShield:オープンワールドのマルチエージェントシステム攻撃に対する二重非定常継続的防御

OpenEvoShieldは、LLMベースのマルチエージェントシステムにおける攻撃戦略の適応と正常行動のドリフトという二重の動的変化に対処する継続的防御フレームワークであり、非対称レートコントローラ、動的境界更新、EWC正則化ポリシーアンサンブル、エネルギー検出器を用いて、100ラウンドの展開において未知の攻撃を低い誤検出率で検出する。

ソースarXiv AI著者: Litian Zhang, Chaozhuo Li, Yuting Zhang, Zejian Chen, Bingyu Yan, Qiwei Ye

大規模言語モデルに基づくマルチエージェントシステム(LLM-MAS)は、自動運転、金融取引、スマートグリッド管理などの安全クリティカルなアプリケーションに急速に導入されつつある。これらのシステムでは、エージェント間の通信を介してタスクを協調実行するが、攻撃者はこの通信経路を悪用して悪意のある命令を注入し、有害な行動を伝染させることができる。静的脅威とは異なり、これらの攻撃は二重に動的である。攻撃者は導入された防御に対して注入戦略を継続的に洗練させる一方、正常なエージェントの行動もシステムの拡大や環境変化に伴って変化する。既存の防御手法は展開を閉じた世界問題として扱い、訓練時の分布が変化すると急速に性能が低下する。

この課題に対し、研究チームはOpenEvoShieldと呼ばれる共進化的継続的防御フレームワークを提案した。本フレームワークは4つのモジュールから構成される。第1の非対称レートコントローラ(M1)は、二重のドリフト信号から攻撃側の高速学習率と正常側の低速学習率を分離する。第2の正常境界更新器(M2)は、低速レートで動的な行動境界を維持し、正常行動の範囲を定義する。第3のEWC正則化ポリシーアンサンブル(M3)は、過去のポリシーを統合して破滅的忘却を防ぎながら、新たな攻撃パターンに迅速に適応する。第4のエネルギーに基づく多粒度検出器(M4)は、ノード、サブグラフ、グラフレベルの証拠を融合し、未知の攻撃を分布外(OOD)として分類することで、未知の脅威を検出する。

研究チームは、5つのベンチマークデータセットと4つのマルチエージェントトポロジ(完全結合、リング、スターなど)において、100ラウンドの継続的展開実験を実施した。結果は、OpenEvoShieldが静的および継続的ベースラインを大幅に上回り、ほとんどの未知攻撃を低い誤検出率で検出できることを示した。本研究は、マルチエージェントシステムの防御にオープンワールド学習の概念を初めて導入し、LLM-MASの実運用におけるセキュリティ向上に貢献する。コードとデータは公開されている。