PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统
一项新研究提出PlanFlip框架,包含四种针对多智能体LLM系统规划阶段的提示注入攻击。研究发现,更强的模型(如GPT-5)反而更易受攻击,同质化骨干网络存在相关智能体盲点,而推理增强型模型(如DeepSeek-R1)能抵御攻击。提出的两种防御方法检测率高达1.00。
多智能体LLM系统在复杂任务中依赖规划器(Planner)将目标分解为子任务序列,由执行器(Executor)和评论家(Critic)智能体执行和审计。然而,一篇新论文揭示了规划阶段的关键安全漏洞:对规划器上下文的一次注入即可引发级联放大效应,同时污染所有下游子任务。
来自研究团队的论文《PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection》系统性地提出了四种规划阶段提示注入攻击方法:目标替换(PF-1)、优先级反转(PF-2)、上下文污染(PF-3)和角色混淆(PF-4)。这些攻击伪装成合理的工具输出,以逃避关键词过滤器。
研究评估了九个前沿LLM模型,在3479个回合中发现三个重要现象:第一,能力放大脆弱性——GPT-5的攻击成功率(ASR)最高达0.68,反驳了更强模型天生更安全的假设;第二,同质化管道存在相关智能体盲点——GPT-4o和Llama-3.3-70B的ASR接近0,但隐蔽性(Stealth)为1.00且步骤偏移(StepShift)大于0,攻击重构了计划而同一骨干的评论家仍报告对齐(两名独立裁判确认语义偏差仅为-0.20至-0.32,相相关系数r=0.943);第三,推理增强型模型能抵抗注入——DeepSeek-R1在所有攻击中StepShift均为0.00。
针对这些威胁,论文提出了两种防御机制:GoalAnchorCheck(D1)和CrossAgentConsensus(D2),检测率最高达1.00,在16个测试单元中的15个上优于同骨干基线。核心启示是:对于多智能体系统,异质模型多样性是安全的前提;同质骨干的冗余在规划阶段攻击面前毫无防护作用。这篇论文不仅揭示了多智能体LLM系统的新攻击面,还强调了在设计此类系统时,必须考虑模型异质性而不是简单堆叠同质模型,以确保系统的鲁棒性和安全性。