AI News HubLIVE
站内改写2 分钟阅读

OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御

OpenEvoShield是一种针对LLM多智能体系统的持续防御框架,能够应对攻击策略和正常行为双重动态变化,通过不对称速率控制器、动态行为边界更新、正则化策略集成和能量检测器,在100轮部署中有效检测未知攻击并保持低误报率。

来源arXiv AI作者: Litian Zhang, Chaozhuo Li, Yuting Zhang, Zejian Chen, Bingyu Yan, Qiwei Ye

基于大型语言模型的多智能体系统(LLM-MAS)正越来越多地部署于安全关键型应用,例如自动驾驶、金融交易和智能电网管理。在这些系统中,多个智能体通过通信协作完成任务。然而,攻击者可以利用这一通信渠道,向目标智能体注入恶意指令,从而引发连锁反应,传播有害行为。与传统的静态攻击不同,此类威胁具有双重动态性:一方面,攻击者会根据已部署的防御策略不断调整注入方式,以绕过检测;另一方面,正常智能体的行为模式也会随着系统规模的扩大和环境的演变而发生漂移。现有防御机制通常基于封闭世界假设,即假设训练和部署阶段的数据分布保持不变。一旦实际分布发生偏移——无论是来自攻击的主动变化还是正常行为的自然演化——这些机制的性能便会急剧下降。

为了应对这一挑战,来自多所机构的研究人员提出了OpenEvoShield,一种协同进化持续防御框架。该框架包含四个核心模块,分别应对攻击与正常行为双重漂移的不同方面。第一个模块是不对称速率控制器(M1),它从双重漂移信号中分离出攻击侧和正常侧的不同学习率:攻击侧采用快速学习率以迅速适应新的攻击策略,而正常侧采用慢速学习率以保持对正常行为变化的鲁棒性。第二个模块是正常边界更新器(M2),它以慢速学习率维护一个动态的行为边界,该边界用于区分正常行为和异常行为。第三个模块是基于弹性权重巩固(EWC)正则化的策略集成(M3),通过整合多个历史策略,避免灾难性遗忘,同时实现对新攻击模式的快速适应。最后一个模块是基于能量的多粒度检测器(M4),它融合节点级、子图级和图级的多层次证据,将未见过的攻击分类为分布外(OOD)样本,从而实现对未知威胁的检测。

研究团队在五个基准数据集(包括文本分类、对话系统等任务)和四种不同的多智能体拓扑结构(如全连接、环状、星型等)上进行了100轮持续部署实验。结果表明,OpenEvoShield在检测未见攻击方面优于多种静态和持续学习基线方法,同时保持了较低的误报率。该工作首次将开放世界学习的思想引入多智能体系统防御,为LLM-MAS在实际部署中的安全性提供了有力的技术支持。代码和数据已公开发布,以促进后续研究。