AI News HubLIVE
站內改寫1 分鐘閱讀

CHI-Bench:評估AI代理在端到端、長期、政策密集型醫療工作流程中的表現

新基準CHI-Bench旨在評估AI代理在真實醫療工作流程中的端到端自動化能力,重點關注政策密度、多角色組合和多邊互動。測試結果顯示,最佳代理僅能完成28.0%的任務,嚴格透過率低於20%,單會話執行時成功率降至3.8%。研究團隊認為,類似差距可能在其他政策密集、角色複雜的領域中出現。

來源arXiv Computational Linguistics作者: Haolin Chen, Deon Metelski, Leon Qi, Tao Xia, Joonyul Lee, Steve Brown, Kevin Riley, Frank Wang, T. Y. Alvin Liu, Hank Capps MD, Zeyu Tang, Xiangchen Song, Lingjing Kong, Fan Feng, Tianyi Zeng, Zhiwei Liu, Zixian Ma, Hang Jiang, Fangli Geng, Yuan Yuan, Chenyu You, Qingsong Wen, Hua Wei, Yanjie Fu, Yue Zhao, Carl Yang, Biwei Huang, Kun Zhang, Caiming Xiong, Sanmi Koyejo, Eric P. Xing, Philip S. Yu, Weiran Yao

近日,多所研究機構聯合釋出了一項名為CHI-Bench的新基準測試,旨在評估AI代理在端到端、長期、政策密集型醫療工作流程中的自動化能力。該基準測試針對當前AI基準中未充分體現的三個關鍵能力進行測試:政策密度(決策必須基於大量醫療、保險和運營規則)、多角色組合(單一任務要求代理扮演多個角色並進行交接)以及多邊互動(工作流程中的中間步驟涉及多輪對話,如同行評審和患者溝通)。CHI-Bench覆蓋三個領域:提供者預先授權、支付方利用管理和護理管理。每個任務向代理提供一個臨床案例,代理需要在一個高保真模擬器中操作,該模擬器包含20個醫療應用程式,透過87個MCP(Model Context Protocol)工具暴露介面。代理必須透過工具呼叫和撰寫角色文件來驅動工作流達到終端狀態,同時遵循一份超過1290頁的管理式醫療操作手冊。研究團隊測試了30種不同的代理框架和模型組合,結果表明,表現最佳的代理僅能解決28.0%的任務。在嚴格的“pass³”標準(要求代理在所有指標上均達到完美)下,沒有代理的透過率超過20%。當要求代理在單個會話中連續執行所有任務時,平均成功率更是驟降至3.8%。這些結果引發了一個假設:在其他政策密集、角色組合複雜、不可逆的企業領域,也可能出現類似的效能差距。這一研究不僅揭示了當前AI代理在處理複雜、多步驟、規則驅動的醫療工作流程時的侷限性,也為未來代理系統的設計和評估提供了重要參考。