AI News HubLIVE
站内改写3 分钟阅读

使用Amazon Bedrock AgentCore优化检测静默代理故障

Amazon Bedrock AgentCore优化能够发现生产环境中AI代理的静默行为故障——那些通过所有健康检查但产生错误结果的故障。了解如何通过洞察发现、解释和排序跨会话的故障模式,从而优先修复影响最大的问题。

来源AWS Machine Learning Blog作者: Vivek Singh

如果你正在大规模运行AI代理,你可能经历过一种难以检测的现象:仪表盘显示一切正常——99%的完成率、健康的延迟、零错误峰值,但客户投诉却不断涌入,指出结果不正确。例如,订单修改从未真正执行、产品显示“有货”但库存API已超时、审批步骤被跳过。这些是行为故障,与基础设施问题不同:它们从系统视角看是成功完成的,通过了健康检查,只有在客户升级时才会暴露,通常是在影响用户数周之后。

即使对于确实产生错误信号的故障,也存在另一个挑战:当代理每天处理数千次会话并积累数百个错误时,哪些错误值得优先关注?查看单个跟踪记录可以显示单个会话中发生了什么,但无法告诉你这是一个影响30%流量的模式还是一个影响三个会话的边缘情况。

Amazon Bedrock AgentCore优化提供的洞察可以帮助你发现、解释和优先处理已部署AI代理中的行为故障,包括那些从不产生错误信号的静默故障。这些洞察将可观测性模型从被动跟踪检查转变为主动模式检测。它帮助你发现故障、了解其范围,并按优先级顺序进行修复。

AgentCore优化洞察的功能

洞察在你的现有可观测性堆栈之上运行。它消耗你的工具已经收集的跟踪数据,并将其转化为可操作的行为智能。这提供了一种调查能力,帮助你了解影响代理性能的更广泛模式,而不仅仅是单个会话故障。

洞察报告提供以下内容:

排名故障模式发现与根因分析:无需预定义类别或过滤器,即可在数百个会话中揭示排名聚类。每个聚类提供一个聚合解释,涵盖受影响的会话,足够具体以便采取行动而无需打开单个跟踪。模式按受影响会话的比例排序,因此关键问题可以立即与边缘情况区分。

用户意图分析:揭示用户如何在不同场景下与代理交互。生产中的代理经常收到与预期设计不同的请求。意图分析显示用户实际请求的分布,揭示需要解决的覆盖缺口和需要执行的边界范围,无需额外仪器化。

执行洞察:揭示代理在不同场景下的响应方式。执行洞察显示代理采用的策略、会话中行动的进展,以及代理的实际行为与预期设计的偏差。这缩小了“我们构建代理的目的”与“代理实际执行的行为”之间的差距。

故障模式发现

AgentCore分析每个会话跟踪,对照行为故障类型的结构化分类。它检测11种类别,包括幻觉、错误操作、任务指令违反、编排错误、上下文处理问题等。该分析基于策略合规性和行为正确性进行推理,而不仅仅依赖错误信号。这种方法可以检测静默故障。每个检测到的故障在跟踪中产生位置、类别和自然语言描述。然后洞察将这些描述分组为聚类,从而在数百个会话中呈现一个单一命名模式,而不是数百个单独的跟踪条目。

对于每个故障聚类,AgentCore通过执行图向后追溯以确定故障原因。会话表示为跨度图(推理调用、工具执行、子代理调用),系统在推理因果关系之前修剪与故障无关的分支。这种修剪使得在长会话上进行的根因分析变得可行,将50步工作流程缩小到导致故障的特定执行路径。输出为根因位置(日志中的跨度ID)、因果关系分类和修复建议(系统提示更改、工具描述更新或基础设施工作)。然后洞察将根因分组到聚类中。你可能会看到100个故障中的90个共享相同的根本原因和相同的修复类型。

聚类本身告诉你存在哪些故障类型,而范围排名告诉你哪些最重要。每个故障聚类携带受影响会话的数量,聚类根据该数量相对于总分析会话进行排序。两级层次结构将广泛的故障类别与特定的子模式分开。

用户意图分析

除了故障之外,AgentCore还提取代理行为的两个附加视图。用户请求聚类嵌入并分组用户发送给代理的实际提示,揭示生产中的用例分布。你可能会发现40%的流量是你设计的用例,另外30%部分支持,剩余30%是你从未预料到的。

执行洞察

执行摘要提取代理在每个会话中采取的方法和达到的结果。它使用层次汇总策略处理不同长度的会话。然后AgentCore对这些摘要进行聚类以揭示执行模式,包括代理采用的常见策略、这些策略如何与成功或失败相关,以及代理实际行为与预期设计的偏差。

设置洞察

当你有一个代理在Amazon Bedrock AgentCore可观测性中记录了遥测数据时,你可以使用洞察来了解该代理的故障模式、用户意图和执行摘要。可以从AgentCore控制台下的“优化 > 洞察 > 创建洞察”创建洞察配置。

选择要分析的类型:故障分析、用户意图分析和执行摘要。它们可以独立运行或组合运行。连接代理有两种选择:选择通过AgentCore运行时部署的代理端点,或直接指向CloudWatch日志组。设置计划:定期运行自动生成报告,或一次性生成特定时间范围的报告。可选:过滤器和采样可以限定分析范围或对流量子集采样。配置完成后,创建洞察即可开始处理。

实际案例

考虑一个提供投资分析、股票推荐和行业表现数据的市场趋势代理。运行10个会话后,每个洞察分析视图显示以下内容:

故障分析识别出一个故障类别:“幻觉金融数据而未调用工具”,影响10个会话中的1个。代理生成了具体的金融数据点、市场利率和数字声明,并将其作为事实信息呈现,而未调用可用的数据检索工具。这违反了系统提示中关于在提出声明前检索实际数据的指令。根因是系统提示告诉代理以实际数据为基础,但缺乏足够的执行机制来强制在使用工具前提出事实断言。代理绕过了数据验证步骤,将未经核实的信息呈现为权威。此故障未产生错误,会话成功完成。通过洞察,你可以看到根因、受影响的特定会话以及明确的修复路径:加强系统提示以强制在数字声明前调用工具。

用户意图分析自动从收集的跟踪中显示用户请求的分布。这里用户请求聚为3类:档案检索和投资组合评估(5/10)、宏观经济和行业分析(3/10)、多股票比较和分析(2/10)。一半流量是档案和投资组合检索,这告诉你应该优先投资这些方面的可靠性。

执行摘要显示代理在会话中实际执行的操作,揭示其行为与设计意图的偏差。