AI News HubLIVE
站內改寫1 分鐘閱讀

面向電子健康檔案中文檔不一致性的自動檢測

本研究利用通用大語言模型(LLM)的兩階段流水線自動檢測電子健康記錄出院小結中的內部不一致性。在3000份MIMIC-IV-Note出院小結中,流水線發現了3460個候選不一致性,影響69.7%的入院記錄。專家審查揭示了在需要時間推理、演變診斷背景或門診處方知識時出現的失敗模式。研究提出了一個分級本體框架,涵蓋嚴格矛盾和歧義,為後續大規模EHR不一致性分析奠定基礎。

來源arXiv Computational Linguistics作者: Jian Lu, Panyu Chen, Miriam Treggiari, Robert Blessing, Danyang Zhuo, Chunhua Weng, William W. Stead, Anru R. Zhang

電子健康檔案(EHR)中的文檔不一致性可能嚴重影響臨牀推理和患者安全。近日,一項研究探索了利用通用大語言模型(LLM)自動檢測出院小結中內部不一致性的方法。該研究由Jian Lu、Panyu Chen、Miriam Treggiari、Robert Blessing、Danyang Zhuo、Chunhua Weng、William W. Stead和Anru R. Zhang等學者共同完成,成果發表於arXiv預印本(arXiv:2607.22954)。

研究團隊設計了一個兩階段LLM流水線。第一階段使用Gemini 2.5 Pro模型進行開放式候選不一致性識別,第二階段利用Gemini 2.5 Flash模型進行基於上下文的驗證。他們將此流水線應用於從MIMIC-IV-Note數據庫中隨機抽取的3000份出院小結。

結果令人關注:流水線總共識別出3460個候選不一致性,涉及69.7%的入院記錄。這些不一致性覆蓋了多個領域,包括人口統計信息、過敏史、手術過程、診斷、實驗室檢查、藥物治療以及護理計劃等。每個領域的不一致性都直接關係到臨牀推理的準確性或患者安全。例如,人口統計信息的矛盾可能導致身份識別錯誤,而藥物不一致可能造成用藥錯誤。

為進一步評估流水線的可靠性,臨牀專家對部分輸出進行了人工審查。審查揭示了一系列反覆出現的失敗模式,特別是在需要時間推理、理解疾病演變背景或掌握門診處方慣例等場景下,模型表現不佳。這些失敗模式指出了當前LLM在臨牀文檔分析中的侷限性。

在討論部分,作者強調檢測高度依賴上下文。許多標記為不一致的成對語句需要將每個陳述錨定到其來源部分和臨牀領域,然後判斷衝突是真正的矛盾還是缺少上下文信息。為此,他們提出了一套分級本體,涵蓋從嚴格矛盾到歧義的多類型,並通過類別、部分、領域和不一致性軸等維度對每個案例進行表徵。

該研究作為一項形成性研究,為後續驗證性、大規模電子健康檔案不一致性分析奠定了方法論基礎和概念框架。未來工作可在此基礎上開發更可靠、更全面的自動化檢測工具,以提升EHR數據質量和患者安全。