当证据冲突时:检索增强型生物医学问答中的不确定性与顺序效应
本研究通过HealthContradict数据集评估了六个开源大语言模型在五种证据条件下的表现,发现矛盾证据导致准确率下降11.4%–25.2%的预测翻转。提出的冲突感知弃权分数在困难条件下将选择性准确率提升最多33.4个百分点。
检索增强生成(RAG)系统在生物医学领域面临独特挑战:从文献中检索到的证据可能不完整、具有误导性甚至相互矛盾。然而,现有评估方法通常只关注模型在有益上下文下的准确性,忽视了矛盾证据对可靠性的影响。这项发表于BioNLP 2026的研究系统性地探讨了这一问题。
研究团队创建了HealthContradict数据集,并设计了五种检索条件:无检索上下文、仅正确上下文、仅错误上下文,以及两种包含正确和矛盾文档的混合条件(文档顺序相反)。实验覆盖了六个开源大语言模型,包括Llama和Mistral系列等。
关键发现表明,当同一组正确和错误文档仅顺序颠倒时,所有模型的准确率均出现下降,且11.4%至25.2%的预测结果发生翻转。这一顺序效应揭示了模型对证据呈现顺序的敏感性,而不仅仅是证据内容本身。例如,在错误文档优先呈现的条件下,模型更容易受到误导。
为应对这些困难情况,研究者开发了一种冲突感知弃权分数,该分数综合了模型置信度和证据冲突检测器的输出。在仅包含错误文档(IC)和错误文档优先呈现的冲突条件(ICC)这两种最困难条件下,该分数在75%、50%和25%覆盖率下将选择性准确率平均提升7.2至33.4个百分点(IC条件)和3.6至14.4个百分点(ICC条件),相比仅依赖置信度的方法有显著改善。
这项工作将矛盾证据定义为不确定性和鲁棒性的双重问题,并呼吁开发明确考虑证据不一致性的评估和弃权方法。对于临床决策支持等高危应用,该研究具有重要意义——当模型面临冲突信息时,准确弃权可能比冒险作答更为安全。研究者还指出,未来工作可以探索更复杂的冲突检测机制和动态证据排序策略,以进一步提升RAG系统在真实环境中的可靠性。