AgentAtlas:超越LLM智能体的结果排行榜
本文介绍了AgentAtlas框架,该框架通过四个组成部分来评估LLM智能体:六状态控制决策分类法、九类轨迹失败分类法、分类法感知与盲法比较方法以及基准覆盖审计。实验表明,移除显式标签菜单后,所有模型的轨迹准确率下降14-40个百分点,落在0.54-0.62的狭窄区间,且没有模型在所有指标上获胜。
近年来,大型语言模型(LLM)智能体被广泛应用于代码库、浏览器、操作系统、日历、文件系统和工具生态系统中。然而,用于评估这些智能体的基准测试却分散且不统一:每个基准侧重不同的衡量标准,如最终任务成功率、工具调用有效性、重复运行一致性、轨迹安全性或对抗鲁棒性。2024-2025年的多项研究已达成共识:单一的准确率指标已不足以比较可部署的智能体。为此,AgentAtlas框架应运而生,旨在超越传统结果排行榜。
AgentAtlas包含四个关键组成部分。首先,它提出了一个六状态控制决策分类法,将智能体的决策分为行为(Act)、询问(Ask)、拒绝(Refuse)、停止(Stop)、确认(Confirm)和恢复(Recover)六类。这一分类法有助于系统性地描述智能体在不同情境下的行为模式。
其次,AgentAtlas引入了一个九类轨迹失败分类法,并附带两个正交层次标签:主要错误源(primary_error_source)和影响(impact)。这使得研究者能够深入分析智能体失败的根本原因及其后果,而不仅仅是记录失败的发生。
第三,AgentAtlas设计了分类法感知(taxonomy-aware)与分类法盲(taxonomy-blind)的对比方法。通过比较这两种提示模式下的智能体表现,可以量化模型能力中有多少直接来自提示中的明确监督。实验表明,当移除显式的标签菜单后,所有模型的轨迹准确率下降了14到40个百分点,最终稳定在0.54-0.62的狭窄区间内,无论模型家族如何。这一发现揭示了当前评估方法可能高估了模型的内在能力。
最后,AgentAtlas还进行了一项基准覆盖审计,将15个智能体基准与六个行为轴进行映射,揭示了现有基准的覆盖盲区。
在实验中,研究者使用了8个模型(4个前沿闭源模型和4个开源模型),在两种提示模式下生成了1342个测试项。结果显示,没有单一模型能在控制准确率、轨迹诊断和工具上下文效用保留这三个维度上同时取得最佳成绩。这表明,当前智能体的能力评估需要更全面的框架,而非单一的排行榜。
AgentAtlas的价值在于提供了一个系统性的评估协议。论文作者强调,该研究是测量协议的示范,而非新基准的发布。未来,这一框架可能推动智能体评估向更细粒度、更可解释的方向发展。