AI News HubLIVE
サイト内リライト2 分で読了

PlanFlip:計画フェーズのプロンプトインジェクションによるマルチエージェントLLMシステムへの攻撃

新しい研究論文が、マルチエージェントLLMシステムの計画フェーズを標的とした4種類のプロンプトインジェクション攻撃フレームワーク「PlanFlip」を紹介。GPT-5のような強力なモデルほど脆弱であり、同質のバックボーンは相関エージェントの盲点を生み出す一方、DeepSeek-R1のような推論強化モデルは攻撃に耐性を示す。提案された2つの防御手法は最大1.00の検出率を達成。

ソースarXiv AI著者: Yuhang Wang

マルチエージェントLLMシステムは複雑なタスクにおいて、プランナー(Planner)が目標をサブタスク系列に分解し、下流の実行者(Executor)と批評家(Critic)エージェントが実行・監査するという構造を取る。しかし、新たな研究論文は計画フェーズに重大なセキュリティホールを指摘する。プランナーのコンテキストへの単一の注入がカスケード増幅効果を引き起こし、すべての下流サブタスクを同時に汚染するという。

研究チームの論文「PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection」は、計画フェーズのプロンプトインジェクション攻撃を4種類体系的に提案している。目標置換(PF-1)、優先順位反転(PF-2)、コンテキスト汚染(PF-3)、役割混乱(PF-4)である。これらの攻撃は、キーワードフィルターを回避するために、もっともらしいツール出力に偽装される。

9つの最先端LLMを3479エピソードにわたって評価した結果、3つの重要な発見があった。第一に、能力が脆弱性を拡大する——GPT-5の攻撃成功率(ASR)は0.68と最高であり、強力なモデルほど安全であるという仮定に反する。第二に、同質パイプラインには相関エージェントの盲点が存在する——GPT-4oとLlama-3.3-70BのASRはほぼゼロだが、ステルス性(Stealth)は1.00、ステップシフト(StepShift)は0以上であり、攻撃が計画を再構築する一方、同一バックボーンの批評家は整合性を報告する(2人の独立した評価者は意味的偏差を-0.20から-0.32と確認、相関係数r=0.943)。第三に、推論強化モデルは注入に耐性を示す——DeepSeek-R1はすべての攻撃でStepShift=0.00を達成した。

これらの脅威に対して、論文はGoalAnchorCheck(D1)とCrossAgentConsensus(D2)という2つの防御機構を提案する。検出率は最大1.00に達し、16セル中15セルで同一バックボーンのベースラインを上回る。核心的な洞察は、マルチエージェントシステムにおいて異種モデルの多様性がセキュリティの前提条件であるということ——同種バックボーンの冗長性は計画フェーズの攻撃に対して何の保護も提供しない。この論文は、マルチエージェントLLMシステムの新たな攻撃面を明らかにするだけでなく、システム設計においてモデルの異質性を考慮することの重要性を強調している。