醫療大語言模型通常是在教學型資料(如教科書、指南類文本)與臨床資料(如患者病歷、診療記錄)混合而成的語料上訓練出來的,但這兩類資料各自如何塑造模型的能力,此前一直沒有得到清晰回答。由 Yuzheng Fan 等六位作者完成的論文《Didactic knowledge or Clinical Cases? How Data Types Shape Medical Large Language Models》針對這一問題展開研究,該論文已被 NLPCC 2026 接收為口頭報告,並於 2026 年 8 月 26 日提交至 arXiv(編號 arXiv:2609.22161),涉及人工智慧、計算語言學與機器學習(cs.AI、cs.CL、cs.LG)等方向。
在方法上,研究團隊設計了一組詞元對齊(token-matched)實驗:在訓練規模保持一致的前提下,只調整教學資料與臨床資料的比例,然後從多個維度衡量資料構成帶來的影響,包括整體效能、能力畫像(capability profile)以及錯誤模式。評估任務被劃分為兩大類,一類是知識密集型任務,另一類是面向臨床場景的任務,從而可以觀察同一模型在不同需求下的表現差異。
實驗結果揭示出一種不對稱遷移現象。臨床資料能夠提升面向臨床的任務表現,同時在這些模型原本擅長的知識密集型任務上仍然保持競爭力,並不會因為引入真實病例而出現明顯退化;相比之下,教學資料主要改善的是知識密集型任務,對臨床導向任務的增益有限。這意味著兩類資料並非可以簡單互換,它們在能力形成上的分工相當明確。
進一步的錯誤分析指向一個“知—行鴻溝”(knowing-doing gap):模型在知識回憶方面的進步,並不能可靠地推廣到臨床推理。換言之,模型可能“知道”某個醫學事實,卻無法把這種知識穩定地運用在具體的臨床判斷與決策情境中。作者認為,這一發現說明僅以知識問答類指標衡量醫療模型能力可能掩蓋真實短板。
在資料配比方面,研究還觀察到兩點規律。其一,在基於電子健康記錄(EHR)的任務上,少量臨床資料就能帶來大部分收益,繼續增加臨床資料比例的邊際回報遞減;其二,最優的混合比例並非固定值,而是會隨著下游任務對知識儲備與臨床推理的要求而變化,推理要求越高的任務,往往越需要更高的臨床資料佔比。
綜合來看,論文給出的結論帶有明確的實踐指向:醫療大語言模型的資料策劃(data curation)應當是應用驅動的,而不是追求某種通用的“黃金配比”。對於以臨床推理為核心的用例,訓練語料中應當配置更高比例的臨床資料;而對以知識覆蓋為主要目標的應用,教學資料仍然不可替代。作者同時提醒,這些結論來自受控的詞元對齊實驗,具體到不同模型規模、不同臨床任務與不同資料來源時,最佳配比仍需要針對性地驗證與調整。