相同事實,不同診斷:測量與緩解臨牀語言模型中的敍事錨定
研究發現,用於臨牀診斷推理的大語言模型對“社會語言學語域”高度敏感,相同醫學事實以不同風格表達時會導致不同診斷結果。作者將這一現象稱為“敍事錨定”,並構建了1,000個重寫為三種語域人格的USMLE病例數據集。在七個語言模型上,直接提示下所有模型均表現出統計顯著的錨定效應,而思維鏈與顯式去偏指令僅部分緩解且常伴隨準確率下降。新提出的NarrativeShield三智能體流程在診斷前結構化提取並驗證臨牀事實,將錨定差距降至接近零,同時保持較低的不穩定決策率。
大型語言模型在臨牀診斷推理中的應用日益廣泛,但一項新研究揭示了一個令人擔憂的盲點:這些模型不僅對臨牀內容敏感,還會受到表達方式的顯著影響。即使醫學事實完全一致,只要換一種“口吻”或“風格”敍述,模型就可能給出不同的診斷。研究人員將這一現象稱為“敍事錨定”(Narrative Anchoring)。
與以往關注種族、收入等明確人口統計學標識的偏見研究不同,這項研究的創新之處在於將“語域”(即語言使用的社會情境變體)作為唯一的變量。研究者構建了一個由1,000個美國執業醫師資格考試(USMLE)臨牀病例組成的基準數據集,每個病例都被重寫成三種社會語言學上截然不同的“人格”版本,並通過獨立的審計流程確保不同版本之間的事實完全一致。
實驗覆蓋了七個語言模型,橫跨三種架構家族和不同規模。結果顯示,在所有模型上,直接提示下都觀察到了統計顯著的敍事錨定效應,錨定差距在0.064至0.151之間。進一步的測試表明,思維鏈推理和明確的去偏指令只能部分減少這種偏差,而且表面上看似有效的改進常常被準確率下降所混淆,即模型在減少偏差的同時可能犧牲了診斷正確性。
為應對這一挑戰,研究人員提出了“NarrativeShield”,一個由三個智能體組成的流水線。該流水線在模型開始診斷推理之前,先結構化地提取並驗證臨牀事實,從而阻斷敍事風格對推理過程的干擾。實驗結果顯示,NarrativeShield成功將敍事錨定差距降至接近零(-0.004至0.037),並且在所有方法中取得了最低的嚴重不穩定決策率(DSS<0.8),對大多數模型而言只帶來了適度且機制上可預期的準確率成本。
此外,一項壓力測試揭示了一個關鍵的限制:對於未經過指令微調的基礎模型,能否執行去偏干預完全取決於其零樣本指令跟隨能力,而非提示內容本身。這意味着未來的去偏研究需要更加重視模型的底層能力。研究團隊已發佈該數據集,並經過人工驗證確保事實保留,作為獨立資源供學界進一步研究基於語域的臨牀偏見。