早發性結直腸癌在年輕成人中的發病率持續上升,已成為日益受到關注的臨牀問題。然而,與老年患者不同,這一年齡段的“紅旗”症狀目前缺乏基於證據的後續檢查指南。常規的結構化就診記錄往往不足以支持早期發現和隨訪決策,因為它們難以捕捉症狀持續時間、出現背景以及家族史——而家族史正是結直腸癌的公認風險因素。這些信息缺口使自動識別高風險年輕患者變得尤為困難。
為應對這一挑戰,Nikkie Hooman 及其同事提出並評估了一種名為 VERGE 的自動化方法,用於從自由文本臨牀筆記中抽取六種紅旗症狀和家族史風險狀態。該論文於 2026 年 9 月 3 日提交至 arXiv(編號:2609.04366)。VERGE 是一種代理式工作流:首先利用檢索增強生成(RAG)提出初步標籤和相關證據;隨後將結果送入一個有界的驗證—精化循環。這個循環會檢查結果是否有文本依據、在臨牀上是否合理,並可對聲明進行修正和重新檢查,直到問題解決或達到預設上限;仍未解決的聲明則升級為人工審查。
研究團隊在 4,033 對由臨牀醫生標註的“臨牀記錄—發現”樣本上評估了 VERGE,並將其與單智能體基線、基於規則的臨牀語言處理基線以及替代底層語言模型進行比較。結果顯示,與單智能體基線相比,VERGE 減少了假陽性發現:精確率從 0.764 上升到 0.849,馬修斯相關係數(MCC)從 0.681 上升到 0.730。研究指出,這種提升是精確率—召回率權衡中的均衡增益,並非以犧牲檢出真實陽性為代價。更值得注意的是,VERGE 在無人介入的情況下解決了大多數被標記的錯誤,最終僅 1.5% 的聲明需要人工複核。
這項研究的意義在於展示了一種有界且基於驗證的工作流如何減少不必要的陽性結果,同時不削弱對真實陽性事件的檢測能力。對於臨牀語言處理工具而言,這種可靠性是支持年輕患者結直腸癌風險評估的重要前提。VERGE 的路徑不僅適用於結直腸癌,也為其他依賴自由文本臨牀數據的高風險篩查場景提供了借鑑。未來若能結合更豐富的臨牀背景和外部知識,這類方法有望在實際診療工作流中發揮更大作用。