AI News HubLIVE
站内改写1 分钟阅读

通过证据链评估实现校准的选择性事实核查

大型语言模型在事实核查中可能自信地给出错误结论,即使证据薄弱。新框架证据链评估(ECE)允许通过不确定裁决来弃权,从而提升可靠性。在ECE-Bench上,ECE对已回答的声明达到97.8%的选择性准确率,同时仅弃权6/95个案例,主要集中在证据可靠性较低的场景。

来源arXiv AI作者: Dekun Yang

近年来,大型语言模型(LLM)在事实核查任务中展现出强大的能力,但一个潜在的问题始终存在:当支持性证据薄弱、稀疏或内部不一致时,模型仍可能做出高度自信的错误判断。为了解决这一可靠性问题,研究人员提出了证据链评估(Evidence Chain Evaluation, ECE)框架,该框架允许模型在面对不确定证据时选择“弃权”,而非被迫做出真/假二值判定。

ECE系统被设计为一个工具驱动的验证代理。它通过多种途径(网络搜索、学术搜索、可执行检查等)收集证据,然后返回一个结构化的裁决结果,并附带置信度分数和来源级别的元数据。这种设计旨在确保系统在证据不足时能够主动放弃,而不是强行给出一个可能误导用户的结论。

在专门构建的基准测试集ECE-Bench上,ECE取得了以下关键指标:标准准确率为91.6%,覆盖率为93.7%,而在回答的声明上选择性准确率达到97.8%。虽然ECE在整体校准指标(如期望校准误差、Brier得分或AURC)上并未超越最强的检索基线,但它展示了一个明确的选择性预测权衡:系统在回答的声明上保持了极高的准确性,同时仅推迟了95个案例中的6个。值得注意的是,这6个推迟案例中,有5个来自最低的证据可靠性级别L4,这支持了弃权作为一种安全导向机制来处理认识论上薄弱证据的观点。

研究团队已将相关代码开源,并提供了完整的实验复现流程。该研究为提升LLM事实核查系统的可靠性和透明度提供了新的思路,尤其适用于对证据质量要求严格的应用场景。