DeepLens診断エージェント:エージェントワークフロー設計により小型推論モデルがフロンティアLLMと競合
DeepLens診断エージェントは、5段階パイプライン(構造化臨床抽出、エビデンスに基づく検索、制約付き候補生成、明示的エビデンストライアンギュレーション、監査可能な最終決定)を通じて、小型医療推論モデルJSL Medical Small 7B v2の性能を60.14%の診断精度にまで引き上げ、多くのフロンティアモデルを凌駕しつつコストも低減します。このワークフロー設計により、不確実性下での診断推論が信頼可能となり、トレーサビリティを備えた中間成果物を生成することで、高リスクな医療応用に適しています。
John Snow Labsの研究チームが開発したDeepLens診断エージェントは、5段階のワークフローを採用した革新的なエージェントシステムです。このシステムは、小型医療推論モデルJSL Medical Small 7B v2の診断精度を23.99%から60.14%に大幅に向上させ、915症例のDiagnosisArenaベンチマークにおいてClaude Sonnet 4.5やGemini 3.1 Proなどのフロンティアモデルを凌駕すると同時に、コストを35-45%削減しました。この成果は、医療診断のような高リスク領域において、構造化されたプロセス制約が単なるモデルパラメータの拡大やAPIコストの投入よりも重要であることを示しています。
ワークフローは5つの厳密に定義された段階で構成されています。第1段階は構造化臨床抽出で、症例記述から症状、徴候、病歴などの臨床情報を体系的に抽出します。第2段階はエビデンスに基づく検索で、検索拡張生成技術を用いて権威ある医学文献から関連エビデンスを取得します。第3段階は制約付き候補生成で、前段階の結果に基づいて可能性のある診断候補リストを生成します。第4段階はエビデンス三角検証で、複数の情報源からのエビデンスを相互検証して各候補診断の信頼性を評価します。第5段階は監査可能な意思決定で、推論プロセスとエビデンス引用を含む最終診断を出力します。各段階では構造化された中間成果物が生成され、その後の監査やエラー特定を容易にします。
実験結果によれば、このエージェントは標準的な医療ベンチマークで88.2%を達成しましたが、ワークフローなしの同じモデルの診断精度は23.99%に過ぎませんでした。36ポイントの向上は完全にプロセス設計によるものであり、モデルの知識想起によるものではありません。この発見は「より大きなモデルが常に優れている」という従来の認識に挑戦し、不確実性を伴う多段階推論を要する複雑なタスクでは、巧妙に設計されたエージェントワークフローがモデル規模よりも重要な性能てこになることを示しています。
経済性の観点では、DeepLens診断エージェントの1症例あたりの推論コストは0.0072ドル(A100 GPUで約24Kトークン消費)、レイテンシは24秒であり、Claude Sonnet 4.5の0.0110ドルやGemini 3.1 Proの0.0128ドルを大幅に下回りつつ、精度ではそれぞれ9.70ポイントおよび9.17ポイント上回っています。この費用対効果の高さは、リソースが限られた医療環境や大規模な診断支援システムの展開に特に適しています。
さらに重要なことは、このワークフローが生成する中間成果物によって診断プロセス全体が透明かつトレーサブルになることです。医師は各段階の出力を確認し、モデルがなぜ特定の診断を選択したかを理解し、必要に応じて介入することができます。この説明可能性は、信頼性の向上だけでなく、エラー発生時の迅速な問題特定にも寄与します。DeepLens診断エージェントの実践は、強力な基盤モデルと緻密に設計されたプロセス制約を組み合わせることで、小型モデルでも専門分野において大型モデルと同等以上の性能を達成できることを示しています。