医療用の大規模言語モデルは一般に、教科書や指針のような教示的データと、患者記録のような臨床データを混ぜたコーパスで訓練されている。しかし、この二種類のデータがそれぞれモデルの能力をどう形作るのかは、これまで明確ではなかった。Yuzheng Fan 氏ら6名による論文「Didactic knowledge or Clinical Cases? How Data Types Shape Medical Large Language Models」はこの問いに取り組み、NLPCC 2026 の口頭発表として採択された。論文は2026年8月26日に arXiv へ投稿され(arXiv:2609.22161)、人工知能・計算言語学・機械学習(cs.AI、cs.CL、cs.LG)の領域にまたがる内容となっている。
手法の中心は、トークン数を揃えた(token-matched)一連の実験である。訓練規模を固定したまま教示データと臨床データの比率だけを変化させ、データ構成がもたらす影響を多角的に評価した。評価軸は、全体性能、能力プロファイル、そして誤りパターンであり、タスクは知識集約型と臨床志向型の二種類に分けられている。これにより、同じモデルでも要求される能力によって挙動がどう変わるかを観察できる。
実験結果からは、非対称な転移という現象が浮かび上がった。臨床データは臨床志向タスクの性能を高めつつ、モデルが元来得意とする知識集約型タスクでも競争力を維持する。実際の症例を加えても知識面が大きく損なわれることはない。対して教示データは主に知識集約型タスクを改善し、臨床志向タスクへの寄与は限定的である。つまり両者は単純に置き換え可能ではなく、能力形成における役割分担がはっきりしている。
さらに誤り分析は「知—行ギャップ(knowing-doing gap)」を示唆する。知識の想起に関する改善は、臨床推論へ確実に一般化するわけではない。モデルはある医学的事実を「知って」いても、それを具体的な臨床判断や意思決定の場面で安定して使いこなせない可能性がある。著者らはこの発見から、知識问答型の指標だけで医療モデルの能力を測ると、実際の弱点が見落とされうると指摘する。
データの混合比についても二つの傾向が確認された。第一に、電子カルテ(EHR)に基づくタスクでは、少量の臨床データで効果の大部分が得られ、臨床データの比率を増やし続けても限界的な改善は小さくなる。第二に、最適な混合比は固定値ではなく、下流タスクが求める知識量と臨床推論の要求度に応じて変動する。推論の要求が高いタスクほど、臨床データの比率を高める必要がある。
全体として、論文の結論は実務志向である。医療大言語モデルのデータ整備は応用目的に基づいて行うべきであり、万能の「黄金比」を追うべきではない。臨床推論を核とする用途では臨床データを厚くし、知識の網羅性を主目的とする用途では教示データが依然として不可欠である。ただし著者らは、今回の知見が統制されたトークン一致実験から得られたものであるとも注意を促している。モデル規模、臨床タスクの種類、データ源が異なれば、最適な比率は個別に検証・調整する必要がある。