AI News HubLIVE
站内改写1 分钟阅读

面向电子健康档案中文档不一致性的自动检测

本研究利用通用大语言模型(LLM)的两阶段流水线自动检测电子健康记录出院小结中的内部不一致性。在3000份MIMIC-IV-Note出院小结中,流水线发现了3460个候选不一致性,影响69.7%的入院记录。专家审查揭示了在需要时间推理、演变诊断背景或门诊处方知识时出现的失败模式。研究提出了一个分级本体框架,涵盖严格矛盾和歧义,为后续大规模EHR不一致性分析奠定基础。

来源arXiv Computational Linguistics作者: Jian Lu, Panyu Chen, Miriam Treggiari, Robert Blessing, Danyang Zhuo, Chunhua Weng, William W. Stead, Anru R. Zhang

电子健康档案(EHR)中的文档不一致性可能严重影响临床推理和患者安全。近日,一项研究探索了利用通用大语言模型(LLM)自动检测出院小结中内部不一致性的方法。该研究由Jian Lu、Panyu Chen、Miriam Treggiari、Robert Blessing、Danyang Zhuo、Chunhua Weng、William W. Stead和Anru R. Zhang等学者共同完成,成果发表于arXiv预印本(arXiv:2607.22954)。

研究团队设计了一个两阶段LLM流水线。第一阶段使用Gemini 2.5 Pro模型进行开放式候选不一致性识别,第二阶段利用Gemini 2.5 Flash模型进行基于上下文的验证。他们将此流水线应用于从MIMIC-IV-Note数据库中随机抽取的3000份出院小结。

结果令人关注:流水线总共识别出3460个候选不一致性,涉及69.7%的入院记录。这些不一致性覆盖了多个领域,包括人口统计信息、过敏史、手术过程、诊断、实验室检查、药物治疗以及护理计划等。每个领域的不一致性都直接关系到临床推理的准确性或患者安全。例如,人口统计信息的矛盾可能导致身份识别错误,而药物不一致可能造成用药错误。

为进一步评估流水线的可靠性,临床专家对部分输出进行了人工审查。审查揭示了一系列反复出现的失败模式,特别是在需要时间推理、理解疾病演变背景或掌握门诊处方惯例等场景下,模型表现不佳。这些失败模式指出了当前LLM在临床文档分析中的局限性。

在讨论部分,作者强调检测高度依赖上下文。许多标记为不一致的成对语句需要将每个陈述锚定到其来源部分和临床领域,然后判断冲突是真正的矛盾还是缺少上下文信息。为此,他们提出了一套分级本体,涵盖从严格矛盾到歧义的多类型,并通过类别、部分、领域和不一致性轴等维度对每个案例进行表征。

该研究作为一项形成性研究,为后续验证性、大规模电子健康档案不一致性分析奠定了方法论基础和概念框架。未来工作可在此基础上开发更可靠、更全面的自动化检测工具,以提升EHR数据质量和患者安全。