早发性结直肠癌在年轻成人中的发病率持续上升,已成为日益受到关注的临床问题。然而,与老年患者不同,这一年龄段的“红旗”症状目前缺乏基于证据的后续检查指南。常规的结构化就诊记录往往不足以支持早期发现和随访决策,因为它们难以捕捉症状持续时间、出现背景以及家族史——而家族史正是结直肠癌的公认风险因素。这些信息缺口使自动识别高风险年轻患者变得尤为困难。
为应对这一挑战,Nikkie Hooman 及其同事提出并评估了一种名为 VERGE 的自动化方法,用于从自由文本临床笔记中抽取六种红旗症状和家族史风险状态。该论文于 2026 年 9 月 3 日提交至 arXiv(编号:2609.04366)。VERGE 是一种代理式工作流:首先利用检索增强生成(RAG)提出初步标签和相关证据;随后将结果送入一个有界的验证—精化循环。这个循环会检查结果是否有文本依据、在临床上是否合理,并可对声明进行修正和重新检查,直到问题解决或达到预设上限;仍未解决的声明则升级为人工审查。
研究团队在 4,033 对由临床医生标注的“临床记录—发现”样本上评估了 VERGE,并将其与单智能体基线、基于规则的临床语言处理基线以及替代底层语言模型进行比较。结果显示,与单智能体基线相比,VERGE 减少了假阳性发现:精确率从 0.764 上升到 0.849,马修斯相关系数(MCC)从 0.681 上升到 0.730。研究指出,这种提升是精确率—召回率权衡中的均衡增益,并非以牺牲检出真实阳性为代价。更值得注意的是,VERGE 在无人介入的情况下解决了大多数被标记的错误,最终仅 1.5% 的声明需要人工复核。
这项研究的意义在于展示了一种有界且基于验证的工作流如何减少不必要的阳性结果,同时不削弱对真实阳性事件的检测能力。对于临床语言处理工具而言,这种可靠性是支持年轻患者结直肠癌风险评估的重要前提。VERGE 的路径不仅适用于结直肠癌,也为其他依赖自由文本临床数据的高风险筛查场景提供了借鉴。未来若能结合更丰富的临床背景和外部知识,这类方法有望在实际诊疗工作流中发挥更大作用。