CHI-Bench:評估AI代理在端到端、長期、政策密集型醫療工作流程中的表現
新基準CHI-Bench旨在評估AI代理在真實醫療工作流程中的端到端自動化能力,重點關注政策密度、多角色組合和多邊互動。測試結果顯示,最佳代理僅能完成28.0%的任務,嚴格透過率低於20%,單會話執行時成功率降至3.8%。研究團隊認為,類似差距可能在其他政策密集、角色複雜的領域中出現。
近日,多所研究機構聯合釋出了一項名為CHI-Bench的新基準測試,旨在評估AI代理在端到端、長期、政策密集型醫療工作流程中的自動化能力。該基準測試針對當前AI基準中未充分體現的三個關鍵能力進行測試:政策密度(決策必須基於大量醫療、保險和運營規則)、多角色組合(單一任務要求代理扮演多個角色並進行交接)以及多邊互動(工作流程中的中間步驟涉及多輪對話,如同行評審和患者溝通)。CHI-Bench覆蓋三個領域:提供者預先授權、支付方利用管理和護理管理。每個任務向代理提供一個臨床案例,代理需要在一個高保真模擬器中操作,該模擬器包含20個醫療應用程式,透過87個MCP(Model Context Protocol)工具暴露介面。代理必須透過工具呼叫和撰寫角色文件來驅動工作流達到終端狀態,同時遵循一份超過1290頁的管理式醫療操作手冊。研究團隊測試了30種不同的代理框架和模型組合,結果表明,表現最佳的代理僅能解決28.0%的任務。在嚴格的“pass³”標準(要求代理在所有指標上均達到完美)下,沒有代理的透過率超過20%。當要求代理在單個會話中連續執行所有任務時,平均成功率更是驟降至3.8%。這些結果引發了一個假設:在其他政策密集、角色組合複雜、不可逆的企業領域,也可能出現類似的效能差距。這一研究不僅揭示了當前AI代理在處理複雜、多步驟、規則驅動的醫療工作流程時的侷限性,也為未來代理系統的設計和評估提供了重要參考。