PlanFlip:透過規劃階段提示注入攻擊多智慧體LLM系統
一項新研究提出PlanFlip框架,包含四種針對多智慧體LLM系統規劃階段的提示注入攻擊。研究發現,更強的模型(如GPT-5)反而更易受攻擊,同質化骨幹網路存在相關智慧體盲點,而推理增強型模型(如DeepSeek-R1)能抵禦攻擊。提出的兩種防禦方法檢測率高達1.00。
多智慧體LLM系統在複雜任務中依賴規劃器(Planner)將目標分解為子任務序列,由執行器(Executor)和評論家(Critic)智慧體執行和審計。然而,一篇新論文揭示了規劃階段的關鍵安全漏洞:對規劃器上下文的一次注入即可引發級聯放大效應,同時汙染所有下游子任務。
來自研究團隊的論文《PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection》系統性地提出了四種規劃階段提示注入攻擊方法:目標替換(PF-1)、優先順序反轉(PF-2)、上下文汙染(PF-3)和角色混淆(PF-4)。這些攻擊偽裝成合理的工具輸出,以逃避關鍵詞過濾器。
研究評估了九個前沿LLM模型,在3479個回合中發現三個重要現象:第一,能力放大脆弱性——GPT-5的攻擊成功率(ASR)最高達0.68,反駁了更強模型天生更安全的假設;第二,同質化管道存在相關智慧體盲點——GPT-4o和Llama-3.3-70B的ASR接近0,但隱蔽性(Stealth)為1.00且步驟偏移(StepShift)大於0,攻擊重構了計劃而同一骨幹的評論家仍報告對齊(兩名獨立裁判確認語義偏差僅為-0.20至-0.32,相相關係數r=0.943);第三,推理增強型模型能抵抗注入——DeepSeek-R1在所有攻擊中StepShift均為0.00。
針對這些威脅,論文提出了兩種防禦機制:GoalAnchorCheck(D1)和CrossAgentConsensus(D2),檢測率最高達1.00,在16個測試單元中的15個上優於同骨幹基線。核心啟示是:對於多智慧體系統,異質模型多樣性是安全的前提;同質骨幹的冗餘在規劃階段攻擊面前毫無防護作用。這篇論文不僅揭示了多智慧體LLM系統的新攻擊面,還強調了在設計此類系統時,必須考慮模型異質性而不是簡單堆疊同質模型,以確保系統的魯棒性和安全性。