大型語言模型作為統一多模態學習器用於臨牀預測
該研究提出將電子健康記錄中的多模態數據(包括結構化檢測值和自由文本臨牀敍述)全部轉換為自然語言序列,直接微調預訓練語言模型,無需專門的多模態融合架構。在住院死亡率、移植後移植物失效和急診分診三項臨牀預測任務中,該方法與或超過特定任務的多模態基線,並優於臨牀部署的梯度提升模型,大幅降低了系統複雜度。
電子健康記錄(EHR)中同時包含自由文本的臨牀敍述和結構化測量數據(如生命體徵、實驗室檢查結果和合並症)。然而,當前的臨牀預測系統大多依賴任務特定的融合架構——為每種模態配備專用編碼器,再通過學習到的組合機制進行整合。這種方案每遇到新任務或新臨牀場景都必須重新設計,複雜度高且難以推廣。來自多家機構的研究者提出了一種更簡潔的替代方案:將患者的所有數據(無論模態)統一轉換為單一的自然語言序列,然後端到端微調預訓練語言模型,無需任何架構修改來實現融合。該方法在三個不同的臨牀預測任務上進行了評估:基於MIMIC-III數據集的住院死亡率預測、利用德國移植中心縱向數據進行的移植物失效預測,以及基於救護車記錄進行的急診分診分類。研究對比了基於編碼器(ModernBERT)和基於解碼器(Llama 3.1、Gemma、DeepSeek-R1-Qwen、Qwen3)的微調模型,與已有的多模態基線模型以及用於移植後患者管理的臨牀梯度提升模型(針對移植物失效任務)進行比較。結果在所有三個任務中,統一的文本序列化方法均達到或超過了任務特定的多模態基線,並且在移植物失效預測上優於臨牀上部署的梯度提升系統。這一發現表明,無需定製融合架構,僅基於序列化的單一範式足以應對多模態臨牀預測,在匹配或超越專門設計模型性能的同時大幅降低了系統複雜度。本研究由Ajay Madhavan Ravichandran等八位作者完成,於2026年7月16日提交至arXiv,論文編號2607.15380,歸屬於計算與語言(cs.CL)和人工智能(cs.AI)領域。該成果為臨牀預測系統的簡化提供了重要思路,有望推動大型語言模型在醫療領域的更廣泛應用。臨牀醫生和AI研究人員應關注這一進展,因為它可能改變未來電子健康記錄數據分析的方式。