AI News HubLIVE
站内改写2 分钟阅读

相同事实,不同诊断:测量与缓解临床语言模型中的叙事锚定

研究发现,用于临床诊断推理的大语言模型对“社会语言学语域”高度敏感,相同医学事实以不同风格表达时会导致不同诊断结果。作者将这一现象称为“叙事锚定”,并构建了1,000个重写为三种语域人格的USMLE病例数据集。在七个语言模型上,直接提示下所有模型均表现出统计显著的锚定效应,而思维链与显式去偏指令仅部分缓解且常伴随准确率下降。新提出的NarrativeShield三智能体流程在诊断前结构化提取并验证临床事实,将锚定差距降至接近零,同时保持较低的不稳定决策率。

来源arXiv Computational Linguistics作者: Prabhjot Singh, Pritam Deka, Vijay Chennareddy

大型语言模型在临床诊断推理中的应用日益广泛,但一项新研究揭示了一个令人担忧的盲点:这些模型不仅对临床内容敏感,还会受到表达方式的显著影响。即使医学事实完全一致,只要换一种“口吻”或“风格”叙述,模型就可能给出不同的诊断。研究人员将这一现象称为“叙事锚定”(Narrative Anchoring)。

与以往关注种族、收入等明确人口统计学标识的偏见研究不同,这项研究的创新之处在于将“语域”(即语言使用的社会情境变体)作为唯一的变量。研究者构建了一个由1,000个美国执业医师资格考试(USMLE)临床病例组成的基准数据集,每个病例都被重写成三种社会语言学上截然不同的“人格”版本,并通过独立的审计流程确保不同版本之间的事实完全一致。

实验覆盖了七个语言模型,横跨三种架构家族和不同规模。结果显示,在所有模型上,直接提示下都观察到了统计显著的叙事锚定效应,锚定差距在0.064至0.151之间。进一步的测试表明,思维链推理和明确的去偏指令只能部分减少这种偏差,而且表面上看似有效的改进常常被准确率下降所混淆,即模型在减少偏差的同时可能牺牲了诊断正确性。

为应对这一挑战,研究人员提出了“NarrativeShield”,一个由三个智能体组成的流水线。该流水线在模型开始诊断推理之前,先结构化地提取并验证临床事实,从而阻断叙事风格对推理过程的干扰。实验结果显示,NarrativeShield成功将叙事锚定差距降至接近零(-0.004至0.037),并且在所有方法中取得了最低的严重不稳定决策率(DSS<0.8),对大多数模型而言只带来了适度且机制上可预期的准确率成本。

此外,一项压力测试揭示了一个关键的限制:对于未经过指令微调的基础模型,能否执行去偏干预完全取决于其零样本指令跟随能力,而非提示内容本身。这意味着未来的去偏研究需要更加重视模型的底层能力。研究团队已发布该数据集,并经过人工验证确保事实保留,作为独立资源供学界进一步研究基于语域的临床偏见。