随着混合云和多云基础设施规模不断扩大,数据保护和灾难恢复团队面临的运维复杂度持续上升。HPE Zerto 与 AWS 合作,构建了一个基于 Amazon Bedrock 的智能体故障排查系统,并将其部署在客户本地环境中,帮助运维人员通过自然语言快速获取可操作的洞察。Zerto 平台本身提供网络弹性、灾难恢复和持续数据保护能力,在此基础上,新系统进一步降低数据丢失和停机时间,并支持从勒索软件事件、宕机和其他中断中快速恢复。
业务挑战方面,运维团队需要持续监控保护健康状态、验证 SLA 合规性、解读告警并排查故障;但这些信息通常分散在日志、告警、事件和文档中。新手管理员难以判断症状或选择安全的修复路径,管理人员也难以快速获得风险摘要。在宕机或网络攻击期间,信息不确定性的代价极高,因此需要一种将复杂韧性数据转化为可操作答案、且不增加额外运维负担的解决方案。
系统以 pod 的形式随 Zerto 产品部署在本地,用户可直接在既有 UI 中通过聊天界面使用。团队选择 Amazon Bedrock 主要考虑安全与治理、模型灵活性及运维集成三个方面;同时利用 Amazon Bedrock Guardrails 在推理前后约束内容,确保提示词与输出符合企业政策。架构包含 UI 层、智能体层、智能层和可观测性层:UI 通过 SSE 实时展示排查进展;智能体层由运行在本地的 Strands Agents 框架构建,能够访问本地会话历史、通过本地 MCP 服务器暴露 ZVM API,并通过 Amazon Bedrock Knowledge Bases 获取公共文档和 Runbook;智能层由 Inference、Security、Limits and quotas 组成,使用 IAM 角色标签实现租户级请求标记,并用 CloudWatch、DynamoDB、Lambda 执行配额和成本控制;可观测性层则将遥测数据发送至 CloudWatch。
从智能体流程看,系统由 Orchestrator 智能体统一调度多个子智能体。Orchestrator 可以直接回答状态检查等常规问题,也可以将复杂的日志排查任务委派给专门的子智能体。每个子智能体拥有独立上下文、系统提示词和工具,并使用更强的模型处理推理密集型任务,最终把精简后的报告返回给父智能体,避免原始日志污染上下文。ZVM 智能体负责服务崩溃、网络问题、升级失败等 ZVM 相关故障;VRA 智能体负责复制延迟、站点间网络等 Zerto Replication Engine 相关故障。
工程挑战方面,团队在模型选择上先以较强模型完成概念验证,再通过自动化评估比较速度更快、成本更低的候选模型,最终形成多模型架构。评估机制基于 PyTest 与 Strands Agents Evals SDK,包含基本单轮查询评估、多轮完整对话评估(使用用户模拟器)和动态测试评估三类;每项测试配备响应、轨迹、延迟和 Token 四个评估器,用于持续监控代理行为、回归与改进。团队强调 Strands Agents 免除了编写僵化工作流和样板代码的负担,并内置评估与可观测性,从而可以在整个开发生命周期中更快迭代。另一个重要约束是本地化部署:容灾基础设施往往处于隔离网络、低延迟或严格数据驻留环境,因此智能体运行时完全在 ZVM 设备内运行,只有模型推理和知识库查询通过 HTTPS 发送到 AWS。
该系统于 2026 年第二季度发布。截至发布后,已有超过 20% 的 HPE Zerto 客户采用并积极使用这一智能体系统。在生产使用中,受支持工作流的支持工单数量下降了 10%,表明 AI 辅助的灾备运维正在取得实际成效。该系统的回答基于实时环境数据和可信产品文档,能够帮助运维团队回答操作问题、开展调查、识别可能的根本原因并排定风险优先级,从而提高运营效率并加强恢复就绪度。