NEXUS:面向工具使用LLM代理的结构化运行时安全监控
NEXUS是一个结构化计划安全监控器,结合确定性安全规则、参数级检查和校准的逻辑回归风险评分,对LLM代理执行四种干预措施:允许、阻止、请求确认或请求修订。在多个基准测试中,NEXUS表现出色,F1分数高达0.949,延迟仅0.205毫秒。
随着大型语言模型(LLM)代理越来越多地执行高风险操作,例如自动交易、软件部署和敏感数据访问,运行时安全监控变得至关重要。传统的基于规则的安全系统往往过于僵化,无法处理代理行为的多样性和复杂性。NEXUS(神经执行效用与安全)系统提出了一种结构化计划安全监控器,它应用正式干预策略,能够从四个动作中选择一个:允许、阻止、请求确认或请求修订。这种分级干预方式使得系统可以在必要时阻止危险操作,同时避免过度阻塞合法行为。
NEXUS结合了确定性安全规则、参数级检查以及校准的逻辑回归风险评分。确定性规则可以快速捕获已知的高风险模式,而参数级检查则对每个函数调用的参数进行细致验证。风险评分器通过逻辑回归模型对历史数据进行校准,从而对未见过的模式进行风险评估。这种混合方法实现了分级升级:对于低风险操作,系统可能直接允许;对于中风险操作,可能请求用户确认;对于高风险操作,则直接阻止或请求修改。
在性能评估中,NEXUS在多个基准测试中展现了强大的结果。在一个包含128个实例的合成基准上,NEXUS的F1分数达到0.949,四类干预准确率为0.6406,比纯规则干预选择提高了27.3个百分点。在R-Judge基准上,NEXUS的F1分数为0.861,优于纯规则的0.849。在AgentHarm基准上,由于威胁模型的限制,NEXUS与纯规则持平。在IPI基准上,NEXUS实现了0%的攻击成功率,同时保持了99%的控制允许率。此外,在专门设计用于测试规则盲场景的NEXUS-Stress基准上,NEXUS的F1分数为0.881,这充分说明了细粒度干预路由的难度。
在效率方面,NEXUS的中位延迟仅为0.205毫秒,对典型代理循环的额外开销低于0.1%,这使得它非常适合实时应用。代码、基准测试和校准的风险评分器均已公开发布,为研究人员和工程师提供了重要的工具。该工作为LLM代理的安全部署提供了一种高效且可扩展的解决方案,有望在未来的AI系统中发挥关键作用。