醫療大語言模型通常是在教學型數據(如教科書、指南類文本)與臨牀數據(如患者病歷、診療記錄)混合而成的語料上訓練出來的,但這兩類數據各自如何塑造模型的能力,此前一直沒有得到清晰回答。由 Yuzheng Fan 等六位作者完成的論文《Didactic knowledge or Clinical Cases? How Data Types Shape Medical Large Language Models》針對這一問題展開研究,該論文已被 NLPCC 2026 接收為口頭報告,並於 2026 年 8 月 26 日提交至 arXiv(編號 arXiv:2609.22161),涉及人工智能、計算語言學與機器學習(cs.AI、cs.CL、cs.LG)等方向。
在方法上,研究團隊設計了一組詞元對齊(token-matched)實驗:在訓練規模保持一致的前提下,只調整教學數據與臨牀數據的比例,然後從多個維度衡量數據構成帶來的影響,包括整體性能、能力畫像(capability profile)以及錯誤模式。評估任務被劃分為兩大類,一類是知識密集型任務,另一類是面向臨牀場景的任務,從而可以觀察同一模型在不同需求下的表現差異。
實驗結果揭示出一種不對稱遷移現象。臨牀數據能夠提升面向臨牀的任務表現,同時在這些模型原本擅長的知識密集型任務上仍然保持競爭力,並不會因為引入真實病例而出現明顯退化;相比之下,教學數據主要改善的是知識密集型任務,對臨牀導向任務的增益有限。這意味着兩類數據並非可以簡單互換,它們在能力形成上的分工相當明確。
進一步的錯誤分析指向一個“知—行鴻溝”(knowing-doing gap):模型在知識回憶方面的進步,並不能可靠地推廣到臨牀推理。換言之,模型可能“知道”某個醫學事實,卻無法把這種知識穩定地運用在具體的臨牀判斷與決策情境中。作者認為,這一發現説明僅以知識問答類指標衡量醫療模型能力可能掩蓋真實短板。
在數據配比方面,研究還觀察到兩點規律。其一,在基於電子健康記錄(EHR)的任務上,少量臨牀數據就能帶來大部分收益,繼續增加臨牀數據比例的邊際回報遞減;其二,最優的混合比例並非固定值,而是會隨着下游任務對知識儲備與臨牀推理的要求而變化,推理要求越高的任務,往往越需要更高的臨牀數據佔比。
綜合來看,論文給出的結論帶有明確的實踐指向:醫療大語言模型的數據策劃(data curation)應當是應用驅動的,而不是追求某種通用的“黃金配比”。對於以臨牀推理為核心的用例,訓練語料中應當配置更高比例的臨牀數據;而對以知識覆蓋為主要目標的應用,教學數據仍然不可替代。作者同時提醒,這些結論來自受控的詞元對齊實驗,具體到不同模型規模、不同臨牀任務與不同數據來源時,最佳配比仍需要針對性地驗證與調整。