AI News HubLIVE
站内改写1 分钟阅读

CHI-Bench:评估AI代理在端到端、长期、政策密集型医疗工作流程中的表现

新基准CHI-Bench旨在评估AI代理在真实医疗工作流程中的端到端自动化能力,重点关注政策密度、多角色组合和多边交互。测试结果显示,最佳代理仅能完成28.0%的任务,严格通过率低于20%,单会话执行时成功率降至3.8%。研究团队认为,类似差距可能在其他政策密集、角色复杂的领域中出现。

来源arXiv Computational Linguistics作者: Haolin Chen, Deon Metelski, Leon Qi, Tao Xia, Joonyul Lee, Steve Brown, Kevin Riley, Frank Wang, T. Y. Alvin Liu, Hank Capps MD, Zeyu Tang, Xiangchen Song, Lingjing Kong, Fan Feng, Tianyi Zeng, Zhiwei Liu, Zixian Ma, Hang Jiang, Fangli Geng, Yuan Yuan, Chenyu You, Qingsong Wen, Hua Wei, Yanjie Fu, Yue Zhao, Carl Yang, Biwei Huang, Kun Zhang, Caiming Xiong, Sanmi Koyejo, Eric P. Xing, Philip S. Yu, Weiran Yao

近日,多所研究机构联合发布了一项名为CHI-Bench的新基准测试,旨在评估AI代理在端到端、长期、政策密集型医疗工作流程中的自动化能力。该基准测试针对当前AI基准中未充分体现的三个关键能力进行测试:政策密度(决策必须基于大量医疗、保险和运营规则)、多角色组合(单一任务要求代理扮演多个角色并进行交接)以及多边交互(工作流程中的中间步骤涉及多轮对话,如同行评审和患者沟通)。CHI-Bench覆盖三个领域:提供者预先授权、支付方利用管理和护理管理。每个任务向代理提供一个临床案例,代理需要在一个高保真模拟器中操作,该模拟器包含20个医疗应用程序,通过87个MCP(Model Context Protocol)工具暴露接口。代理必须通过工具调用和撰写角色文档来驱动工作流达到终端状态,同时遵循一份超过1290页的管理式医疗操作手册。研究团队测试了30种不同的代理框架和模型组合,结果表明,表现最佳的代理仅能解决28.0%的任务。在严格的“pass³”标准(要求代理在所有指标上均达到完美)下,没有代理的通过率超过20%。当要求代理在单个会话中连续执行所有任务时,平均成功率更是骤降至3.8%。这些结果引发了一个假设:在其他政策密集、角色组合复杂、不可逆的企业领域,也可能出现类似的性能差距。这一研究不仅揭示了当前AI代理在处理复杂、多步骤、规则驱动的医疗工作流程时的局限性,也为未来代理系统的设计和评估提供了重要参考。