CHI-Bench:AIエージェントはエンドツーエンドの長期・政策密集型医療ワークフローを自動化できるか?
新しいベンチマークCHI-Benchは、現実的な医療ワークフローにおけるAIエージェントの自動化能力を評価し、政策密度、マルチロール構成、多者間インタラクションに焦点を当てています。最良のエージェントでもタスク解決率は28.0%にとどまり、厳格なパス率は20%未満、単一セッションでは3.8%に低下しました。研究者らは、他の政策密集型・役割構成型の企業領域でも同様のギャップが生じる可能性があると指摘しています。
近年、AIエージェントによる業務自動化の可能性が広く探求されていますが、現実世界の複雑なワークフロー、特に医療分野におけるエンドツーエンドの自動化は依然として大きな課題です。この課題に取り組むため、複数の研究機関が共同でCHI-Benchと呼ばれる新しいベンチマークを開発しました。このベンチマークは、医療業務の自動化において重要でありながら、既存のベンチマークでは軽視されてきた三つの能力、すなわち政策密度(医療、保険、運用に関する膨大なルールに基づく意思決定)、マルチロール構成(単一のタスクでエージェントが複数の役割を担い、引き継ぎを行う必要があること)、および多者間インタラクション(ワークフローの中間ステップが同僚レビューや患者への連絡などの多ターンダイアログであること)を評価します。CHI-Benchは、プロバイダ事前承認、ペイヤー利用管理、ケア管理の三つの領域にわたる長期的な医療ワークフローをカバーしています。各タスクでは、エージェントに臨床ケースが与えられ、20の医療アプリケーションと87のMCPツールを備えた高忠実度シミュレータ内で操作を行います。エージェントは、ツールコールと役割の成果物作成を通じてワークフローを終了状態に導く必要があり、その際に1,290ページ以上の管理医療運用ハンドブックをガイドとして利用します。研究チームは、30種類のエージェントフレームワークとモデルの組み合わせをテストしました。その結果、最良のエージェントでもタスク解決率はわずか28.0%でした。厳格な「pass³」基準(すべての指標で完璧を要求)では、どのエージェントも20%を超えることはできませんでした。さらに、すべてのタスクを単一のセッションで連続して実行するよう要求した場合、平均成功率は3.8%に急落しました。これらの結果は、AIエージェントが複雑で不可逆的なエンタープライズプロセスを処理する際に、同様のギャップが他の政策密集的で役割構成型の企業領域でも表面化する可能性があることを示唆しています。この研究は、医療ワークフロー自動化の現状を明らかにするだけでなく、将来のエージェントシステムの設計と評価に重要な洞察を提供しています。