大型语言模型作为统一多模态学习器用于临床预测
该研究提出将电子健康记录中的多模态数据(包括结构化检测值和自由文本临床叙述)全部转换为自然语言序列,直接微调预训练语言模型,无需专门的多模态融合架构。在住院死亡率、移植后移植物失效和急诊分诊三项临床预测任务中,该方法与或超过特定任务的多模态基线,并优于临床部署的梯度提升模型,大幅降低了系统复杂度。
电子健康记录(EHR)中同时包含自由文本的临床叙述和结构化测量数据(如生命体征、实验室检查结果和合并症)。然而,当前的临床预测系统大多依赖任务特定的融合架构——为每种模态配备专用编码器,再通过学习到的组合机制进行整合。这种方案每遇到新任务或新临床场景都必须重新设计,复杂度高且难以推广。来自多家机构的研究者提出了一种更简洁的替代方案:将患者的所有数据(无论模态)统一转换为单一的自然语言序列,然后端到端微调预训练语言模型,无需任何架构修改来实现融合。该方法在三个不同的临床预测任务上进行了评估:基于MIMIC-III数据集的住院死亡率预测、利用德国移植中心纵向数据进行的移植物失效预测,以及基于救护车记录进行的急诊分诊分类。研究对比了基于编码器(ModernBERT)和基于解码器(Llama 3.1、Gemma、DeepSeek-R1-Qwen、Qwen3)的微调模型,与已有的多模态基线模型以及用于移植后患者管理的临床梯度提升模型(针对移植物失效任务)进行比较。结果在所有三个任务中,统一的文本序列化方法均达到或超过了任务特定的多模态基线,并且在移植物失效预测上优于临床上部署的梯度提升系统。这一发现表明,无需定制融合架构,仅基于序列化的单一范式足以应对多模态临床预测,在匹配或超越专门设计模型性能的同时大幅降低了系统复杂度。本研究由Ajay Madhavan Ravichandran等八位作者完成,于2026年7月16日提交至arXiv,论文编号2607.15380,归属于计算与语言(cs.CL)和人工智能(cs.AI)领域。该成果为临床预测系统的简化提供了重要思路,有望推动大型语言模型在医疗领域的更广泛应用。临床医生和AI研究人员应关注这一进展,因为它可能改变未来电子健康记录数据分析的方式。