AI News HubLIVE
站内改写2 分钟阅读

DecisionBench:长视界智能工作流中的新兴委托基准

DecisionBench 是一个用于评估长视界智能工作流中新兴委托能力的基准平台。它固定了任务套件(GAIA、tau-bench、BFCL multi-turn)、模型池(11个模型,来自7个供应商家族)、委托接口(call_model及可选的read_profile通道)、确定性技能标注层以及多维指标套件(覆盖质量、成本、延迟、委托率、路由保真度、供应商自我偏好及反事实委托上限)。该基准框架不依赖于代理信息的生成或传递方式,因此可评估学习型路由器、富代理记忆、自适应配置文件构建以及多步委托等方法。研究团队在完整模型池上进行了五次条件参考扫描,共涉及23,375个任务实例。主要发现包括:(i) 在四种感知条件下,平均终端任务质量在统计上无显著差异(|β| = 0.21),因此仅评估质量会忽略关键的编排信号;(ii) 在平均质量接近的情况下,路由保真度(top-1)在7.5%到29.5%之间变化,且传递渠道(按需工具 vs. 预加载描述)对结果的影响大于描述内容本身;(iii) 反事实上限表明,完美委托在每项任务套件上的性能比当前测量值高出15到31个百分点,揭示了未来编排方法巨大的未开发空间。研究团队已公开发布该基准平台、标注层、参考干预套件、分析流水线以及220个按条件运行的存档。

来源arXiv AI作者: Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu

近日,一项名为 DecisionBench 的基准研究被提出,旨在评估长视界智能工作流中的新兴委托能力。该研究由 Yuxuan Gao 等五位作者共同完成,论文已提交至 arXiv(编号:2605.19099)。

DecisionBench 作为一个标准化基准平台,固定了多项关键组件:任务套件包括 GAIA、tau-bench 和 BFCL multi-turn;模型池涵盖11个模型,来自7个供应商家族,包括 OpenAI、Google、Anthropic、Meta、Mistral、Cohere 和 xAI 等;委托接口提供了 call_model 和可选的 read_profile 通道;此外还包含确定性技能标注层和多维指标套件,覆盖质量、成本、延迟、委托率、路由保真度(top-k)、供应商自我偏好及反事实委托上限等。该平台不依赖于代理信息的生成或传递方式,因此可评估学习型路由器、富代理记忆、自适应配置文件构建以及多步委托等方法。

研究团队在完整模型池上进行了五次条件参考扫描,共涉及23,375个任务实例。这五次条件分别是:无感知(模型仅收到任务)、仅自我描述、仅表现数据、以及完整资料(自我描述加表现数据)。结果显示了三个重要发现:首先,在四种感知条件下,平均终端任务质量在统计上无显著差异(|β| = 0.21),因此仅评估质量会忽略关键的编排信号。其次,在平均质量接近的情况下,路由保真度(top-1)在7.5%到29.5%之间变化,且传递渠道(按需工具 vs. 预加载描述)对结果的影响大于描述内容本身。具体而言,当使用按需工具传递代理资料时,路由准确性显著高于预加载描述的方式。最后,反事实上限表明,完美委托在每项任务套件上的性能比当前测量值高出15到31个百分点,揭示了未来编排方法巨大的未开发空间。例如,在 GAIA 套件上,当前最佳路由方法仅达到约60%的准确率,而完美委托理论上可达85%以上。

研究团队已公开发布该基准平台、标注层、参考干预套件、分析流水线以及220个按条件运行的存档。这些资源托管在 GitHub 上,供研究人员复现实验并在此基础上探索新的委托与编排策略。DecisionBench 的提出为多智能体系统研究提供了一个标准化、可复现的评估框架,有望推动该领域的快速发展。