医疗大语言模型通常是在教学型数据(如教科书、指南类文本)与临床数据(如患者病历、诊疗记录)混合而成的语料上训练出来的,但这两类数据各自如何塑造模型的能力,此前一直没有得到清晰回答。由 Yuzheng Fan 等六位作者完成的论文《Didactic knowledge or Clinical Cases? How Data Types Shape Medical Large Language Models》针对这一问题展开研究,该论文已被 NLPCC 2026 接收为口头报告,并于 2026 年 8 月 26 日提交至 arXiv(编号 arXiv:2609.22161),涉及人工智能、计算语言学与机器学习(cs.AI、cs.CL、cs.LG)等方向。
在方法上,研究团队设计了一组词元对齐(token-matched)实验:在训练规模保持一致的前提下,只调整教学数据与临床数据的比例,然后从多个维度衡量数据构成带来的影响,包括整体性能、能力画像(capability profile)以及错误模式。评估任务被划分为两大类,一类是知识密集型任务,另一类是面向临床场景的任务,从而可以观察同一模型在不同需求下的表现差异。
实验结果揭示出一种不对称迁移现象。临床数据能够提升面向临床的任务表现,同时在这些模型原本擅长的知识密集型任务上仍然保持竞争力,并不会因为引入真实病例而出现明显退化;相比之下,教学数据主要改善的是知识密集型任务,对临床导向任务的增益有限。这意味着两类数据并非可以简单互换,它们在能力形成上的分工相当明确。
进一步的错误分析指向一个“知—行鸿沟”(knowing-doing gap):模型在知识回忆方面的进步,并不能可靠地推广到临床推理。换言之,模型可能“知道”某个医学事实,却无法把这种知识稳定地运用在具体的临床判断与决策情境中。作者认为,这一发现说明仅以知识问答类指标衡量医疗模型能力可能掩盖真实短板。
在数据配比方面,研究还观察到两点规律。其一,在基于电子健康记录(EHR)的任务上,少量临床数据就能带来大部分收益,继续增加临床数据比例的边际回报递减;其二,最优的混合比例并非固定值,而是会随着下游任务对知识储备与临床推理的要求而变化,推理要求越高的任务,往往越需要更高的临床数据占比。
综合来看,论文给出的结论带有明确的实践指向:医疗大语言模型的数据策划(data curation)应当是应用驱动的,而不是追求某种通用的“黄金配比”。对于以临床推理为核心的用例,训练语料中应当配置更高比例的临床数据;而对以知识覆盖为主要目标的应用,教学数据仍然不可替代。作者同时提醒,这些结论来自受控的词元对齐实验,具体到不同模型规模、不同临床任务与不同数据来源时,最佳配比仍需要针对性地验证与调整。