Dynatrace新代理揭示AI运维最棘手难题
可观测性平台公司Dynatrace为其Dynatrace Intelligence服务推出新功能,旨在通过确定性实时上下文和自主SRE代理,实现从概率性方法向自主运维的转变,同时保留人工监督。
可观测性平台公司Dynatrace于周一宣布对其Dynatrace Intelligence服务进行一系列升级,旨在摆脱过去基于概率的自主SRE(站点可靠性工程师)方法,转而采用更具确定性的实时上下文和控制。
新扩展旨在自动解决软件基础设施运维事件并防止服务中断,同时保持人工监督和治理。
Dynatrace Intelligence最初于今年1月在该公司旗舰用户大会Perform上发布。现在,Dynatrace新增了用于事件分类和修复的自主代理,以及无代码自定义代理创建功能。该平台还扩展了集成,以便在常用工具和工作流程中实现自主可观测性功能。
这是否意味着我们可以开始庆祝自主SRE的时代(或许在2027年)并跨越到真正的无人值守自主运维?
Dynatrace首席产品官Steve Tack告诉The New Stack,“这不是人与平台之间的二元选择”,即人工主导和代理主导的运维将继续共存。他鼓励我们认识到,真正的目标是“随着对结果信心的增长,逐步迈向更自主的运维”。
爬-走-跑方法
“采用自主SRE方法的客户(以及我们)通常遵循爬-走-跑的方法,”Tack说。“首先,信任我们的确定性和因果AI精确定位根本原因;其次,在此基础上实现修复自动化(可基于因果和预测能力,但仍需人工参与);向‘人在环上’和真正自主行动的迈进,取决于初始步骤中建立的信心。”
Tack解释说,大多数团队从“人在环中”开始,验证Dynatrace已经精确知道和做的事情,然后才让平台自主行动。
“成功的衡量标准不是工程师的生产力,而是根本不需要人工干预的事件百分比,”Tack澄清道。“Dynatrace提供建议和指针,帮助用户根据分类确定应自动化的内容。自主程度由用户决定。”
具有确定性实时理解的AI
详细说明当前产品更新时,Tack和团队指出,Dynatrace将代理式AI与对复杂环境的确定性实时理解相结合。这一切都围绕公司今天定位的“基于事实而非猜测的AI”。
自主SRE代理的核心功能是:当检测到新问题时,自动触发以确定该问题是否属于现有事件调查的一部分。如果确认,代理会用额外见解丰富调查,并用正在进行的调查的引用更新检测到的问题。
在SRE代理家族中,云SRE代理协调修复活动,并与AWS、Microsoft Azure和Google Cloud环境中的代理集成。然后集中发现结果,为自主运维提供单一的可审计记录。
此外还有三个其他关键产品更新:Agent Builder可无代码创建和部署自定义AI代理,将自主运维扩展到环境特有的工作流程;增强版Dynatrace Assist为用户带来自然语言调查和代理就绪工作流程;与云超大规模提供商的更深入连接,以及与ServiceNow、Atlassian和PagerDuty的新集成。
对不合时宜的概率性服务的悲观
Dynatrace指出,其超越依赖概率输出的可观测性的实现,是通过Dynatrace Intelligence将每个行动锚定在确定性、实时系统理解中。每个行动都基于环境特定上下文,并设计为透明、可审计和可治理。
“AI生成洞察与安全、治理执行之间的差距是最大的担忧之一;客户需要确定性、实时上下文以及自动化和审计能力,以推动可信和可靠的结果。”
“投资AI驱动可观测性的企业有机会将数据转化为情报,进而转化为可信的自主行动,”IDC集团副总裁Stephen Elliot表示。“AI生成洞察与安全、治理执行之间的差距是最大的担忧之一;客户需要确定性、实时上下文以及自动化和审计能力,以推动可信和可靠的结果。”
云SRE代理、增强版Dynatrace Assist以及扩展的集成生态系统目前已向DPS上的SaaS客户提供。自主SRE代理和Agent Builder预计将于2026年8月可用。
2027:自主SRE之年?
展望未来,2027年可能是中国羊年、国际足联女足世界杯,或许也是自主SRE(站点可靠性工程师)之年。
尽管其中三个只有两个是确定的,但随着Dynatrace、Microsoft、Datadog和Komodor等平台纷纷推出策略绑定的AI代理以推动自主SRE功能,明年我们可能跨越到真正的无人值守自主运维。