隨著混合雲和多雲基礎設施規模不斷擴大,資料保護和災難恢復團隊面臨的運維複雜度持續上升。HPE Zerto 與 AWS 合作,構建了一個基於 Amazon Bedrock 的智慧體故障排查系統,並將其部署在客戶本地環境中,幫助運維人員透過自然語言快速獲取可操作的洞察。Zerto 平臺本身提供網路彈性、災難恢復和持續資料保護能力,在此基礎上,新系統進一步降低資料丟失和停機時間,並支援從勒索軟體事件、宕機和其他中斷中快速恢復。
業務挑戰方面,運維團隊需要持續監控保護健康狀態、驗證 SLA 合規性、解讀告警並排查故障;但這些資訊通常分散在日誌、告警、事件和文件中。新手管理員難以判斷症狀或選擇安全的修復路徑,管理人員也難以快速獲得風險摘要。在宕機或網路攻擊期間,資訊不確定性的代價極高,因此需要一種將複雜韌性資料轉化為可操作答案、且不增加額外運維負擔的解決方案。
系統以 pod 的形式隨 Zerto 產品部署在本地,使用者可直接在既有 UI 中透過聊天介面使用。團隊選擇 Amazon Bedrock 主要考慮安全與治理、模型靈活性及運維整合三個方面;同時利用 Amazon Bedrock Guardrails 在推理前後約束內容,確保提示詞與輸出符合企業政策。架構包含 UI 層、智慧體層、智慧層和可觀測性層:UI 透過 SSE 即時展示排查進展;智慧體層由執行在本地的 Strands Agents 框架構建,能夠訪問本地會話歷史、透過本地 MCP 伺服器暴露 ZVM API,並透過 Amazon Bedrock Knowledge Bases 獲取公共文件和 Runbook;智慧層由 Inference、Security、Limits and quotas 組成,使用 IAM 角色標籤實現租戶級請求標記,並用 CloudWatch、DynamoDB、Lambda 執行配額和成本控制;可觀測性層則將遙測資料傳送至 CloudWatch。
從智慧體流程看,系統由 Orchestrator 智慧體統一排程多個子智慧體。Orchestrator 可以直接回答狀態檢查等常規問題,也可以將複雜的日誌排查任務委派給專門的子智慧體。每個子智慧體擁有獨立上下文、系統提示詞和工具,並使用更強的模型處理推理密集型任務,最終把精簡後的報告返回給父智慧體,避免原始日誌汙染上下文。ZVM 智慧體負責服務崩潰、網路問題、升級失敗等 ZVM 相關故障;VRA 智慧體負責複製延遲、站點間網路等 Zerto Replication Engine 相關故障。
工程挑戰方面,團隊在模型選擇上先以較強模型完成概念驗證,再透過自動化評估比較速度更快、成本更低的候選模型,最終形成多模型架構。評估機制基於 PyTest 與 Strands Agents Evals SDK,包含基本單輪查詢評估、多輪完整對話評估(使用使用者模擬器)和動態測試評估三類;每項測試配備響應、軌跡、延遲和 Token 四個評估器,用於持續監控代理行為、迴歸與改進。團隊強調 Strands Agents 免除了編寫僵化工作流和樣板程式碼的負擔,並內建評估與可觀測性,從而可以在整個開發生命週期中更快迭代。另一個重要約束是本地化部署:容災基礎設施往往處於隔離網路、低延遲或嚴格資料駐留環境,因此智慧體執行時完全在 ZVM 裝置內執行,只有模型推理和知識庫查詢透過 HTTPS 傳送到 AWS。
該系統於 2026 年第二季度釋出。截至釋出後,已有超過 20% 的 HPE Zerto 客戶採用並積極使用這一智慧體系統。在生產使用中,受支援工作流的支援工單數量下降了 10%,表明 AI 輔助的災備運維正在取得實際成效。該系統的回答基於即時環境資料和可信產品文件,能夠幫助運維團隊回答操作問題、開展調查、識別可能的根本原因並排定風險優先順序,從而提高運營效率並加強恢復就緒度。