AI News HubLIVE
サイト内リライト2 分で読了

GuideSkill: 臨床推論のための実行可能なLLMエージェントスキルの進化

GuideSkillは、臨床診療ガイドラインの診断基準を実行可能な関数にコンパイルし、序数の診断支援スコアを返す外部推論レイヤーである。GuideSkill-Zeroはガイドラインから初期化され、GuideSkill-Evoは症例と診断のペアを用いてスキルを改善する。4つのベンチマークと4つのバックボーンで、GuideSkill-Evoはすべてのバックボーンで最高のマクロ平均精度を達成し、直接推論と比較して18.49%の相対改善、金標準スキルカバレッジを56.5%から99.5%に向上させた。

ソースarXiv AI著者: Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

臨床診療ガイドライン(CPG)は、エビデンスに基づく医療の基盤であり、診断基準を体系的にコード化している。大規模言語モデル(LLM)は臨床推論において大きな可能性を示しているが、既存のシステムの多くはガイドラインをテキストとして検索するか、トレーニング中に内部表現へ吸収するだけであり、ガイドラインに埋め込まれたルールを実際に実行することはほとんどない。このような間接的な利用方法では、複雑な症例においてモデルがガイドラインの手続きに厳密に従うことが難しくなる。

この問題に対して、GuideSkillは新しい枠組みを提案する。これは、Lang Cao氏らが2026年7月28日にarXivへ提出した論文(ID: 2607.26160)で発表された。GuideSkillは外部推論レイヤーとして機能し、疾患固有の診断基準を実行可能な関数にコンパイルし、序数の診断支援スコアを返す。つまり、患者の状態が各診断にどの程度一致するかを順序付きのスコアで示す関数を生成することで、LLMがガイドラインを「実行」できるようにするのである。

フレームワークには二つのバリアントがある。GuideSkill-Zeroはガイドライン文書から直接スキルモジュールを初期化し、診断ルールをプログラム的な関数に変換する。一方、GuideSkill-Evoは、初期スキルを出発点として、ペアとなった症例と診断データを利用して既存のスキルを改善し、不足している診断を追加することができる。推論時には、まずLLMが鑑別診断のリストを生成する。次に、各候補診断に対して、対応するスキルが必要とする特徴を症例から抽出する。最後に、LLM自身のランキングと実行されたスキルのスコアを融合し、最終的な診断提案を生成する。この設計により、モデルのパラメータを変えることなく、外部構造によって明示的なルールを課すことができる。

実験結果は印象的である。4つのベンチマークと4つのバックボーンLLMを用いた評価で、GuideSkill-ZeroはガイドラインRAGベースラインと比較して、マクロ平均精度を平均13.45%向上させた。GuideSkill-Evoは、すべてのバックボーンで最高のマクロ平均精度を達成し、直接推論に対して相対18.49%の改善を示し、金標準スキルカバレッジを56.5%から99.5%に引き上げた。特筆すべきは、Qwen3.5-9B上で、バックボーンのパラメータを一切更新せずに、最強のパラメータ更新ベースラインを11.16%上回ったことである。これは、実行可能なスキルがモデル非依存でありながら、ファインチューニングに匹敵する利得をもたらし得ることを示している。

さらに、専門家評価では、GuideSkillが生成したスキルは臨床的に妥当であり、広く受け入れられるものであると判断された。初期化されたルールも進化したルールも信頼性が高く、実用的な意味を持つことが示唆された。著者らは、実行可能なスキルが、ガイドライン由来の手続きと症例由来の診断パターンを組み合わせるための一般的なメカニズムとして有効だと結論づけている。

GuideSkillの実用上の意義は大きい。スキル層が外部モジュールであるため、ガイドラインが改訂された際に、基盤モデルを再トレーニングすることなくスキルを更新できる。また、実行される関数を監査できるため、透明性が高く、説明責任が求められる医療現場に適している。今後は、臨床ガイドライン以外の構造化知識源への拡張や、医用画像などのマルチモーダル入力との統合が考えられる。現時点では、この論文は実行可能なスキルが宣言的医学知識と頑健なLLM推論の橋渡しになるという有望なコンセプトを示している。