CHI-Bench:评估AI代理在端到端、长期、政策密集型医疗工作流程中的表现
新基准CHI-Bench旨在评估AI代理在真实医疗工作流程中的端到端自动化能力,重点关注政策密度、多角色组合和多边交互。测试结果显示,最佳代理仅能完成28.0%的任务,严格通过率低于20%,单会话执行时成功率降至3.8%。研究团队认为,类似差距可能在其他政策密集、角色复杂的领域中出现。
近日,多所研究机构联合发布了一项名为CHI-Bench的新基准测试,旨在评估AI代理在端到端、长期、政策密集型医疗工作流程中的自动化能力。该基准测试针对当前AI基准中未充分体现的三个关键能力进行测试:政策密度(决策必须基于大量医疗、保险和运营规则)、多角色组合(单一任务要求代理扮演多个角色并进行交接)以及多边交互(工作流程中的中间步骤涉及多轮对话,如同行评审和患者沟通)。CHI-Bench覆盖三个领域:提供者预先授权、支付方利用管理和护理管理。每个任务向代理提供一个临床案例,代理需要在一个高保真模拟器中操作,该模拟器包含20个医疗应用程序,通过87个MCP(Model Context Protocol)工具暴露接口。代理必须通过工具调用和撰写角色文档来驱动工作流达到终端状态,同时遵循一份超过1290页的管理式医疗操作手册。研究团队测试了30种不同的代理框架和模型组合,结果表明,表现最佳的代理仅能解决28.0%的任务。在严格的“pass³”标准(要求代理在所有指标上均达到完美)下,没有代理的通过率超过20%。当要求代理在单个会话中连续执行所有任务时,平均成功率更是骤降至3.8%。这些结果引发了一个假设:在其他政策密集、角色组合复杂、不可逆的企业领域,也可能出现类似的性能差距。这一研究不仅揭示了当前AI代理在处理复杂、多步骤、规则驱动的医疗工作流程时的局限性,也为未来代理系统的设计和评估提供了重要参考。