学习证据充分性边界:面向接地多跳问答的选择性回答
该论文提出证据充分性边界训练法,使多跳问答模型在证据缺失或仅部分支持时放弃作答,当证据链首次充分时给出答案,并在添加冗余证据后保持回答稳定。基于 HotpotQA、2WikiMultiHopQA 与 MuSiQue 构建证据链,使用 Qwen2.5-3B-Instruct 和 LoRA 训练,翻转准确率达 0.807,外部不可回答问题集上的无依据回答率低至 0.095。
一项新研究提出了一种训练框架,帮助多跳问答系统更可靠地判断“何时应拒绝回答”。该论文于 2026 年 9 月 1 日提交至 arXiv(编号 2609.01687),由 Haruto Sato 等五位作者撰写,属于计算与语言(cs.CL)领域。
研究指出,接地问答系统理应在所提供证据支持答案时才作答,但在多跳问答中,部分证据可能让一个并不完整支持的回答看起来具有合理性,使系统难以决定是否应该回应。为此,研究人员定义了“证据充分性边界”这一概念:对于同一个问题,模型在上下文中没有证据或仅有部分证据时应当弃答;当证据链第一次足以支撑答案时,模型应当作答;而此后继续添加冗余证据也不应改变答案。这样的设定能够更加细致地考察模型的选择性回答能力。
为了实现这一目标,团队提出了证据充分性边界训练方法。这是一种面向生成式模型的训练框架,核心思路是构建有序的证据链,并直接监督从“拒绝作答”到“给出答案”的转换过程。训练目标综合了多种信号:层级监督负责让模型感知不同证据数量下的状态,边界翻转间隔用来引导模型在证据首度充分时产生正确的行为切换,边界后稳定性则确保答案在越过充分性边界后不会反复变动,答案召回保护用于维持模型在原始问答任务上的基本表现。
在实验阶段,作者利用 HotpotQA、2WikiMultiHopQA 和 MuSiQue 构建了多条证据链,并从链条层面评估边界定位能力,同时参考原始问答效用与在外部不可回答问题集上的无依据回答率来衡量模型表现。实验中采用 Qwen2.5-3B-Instruct 作为基底模型,以 LoRA 方式进行参数高效微调。结果显示,证据充分性边界训练在所有被测系统中取得了最强的边界定位性能,翻转准确率达到 0.807,高于 token 级弃答基线的 0.781。同时,该方法在外部不可回答评估集上的整体无依据回答率为 0.095,也低于同样基线的 0.101,同时保持了有竞争力的原始问答 F1 分数。
作者总结道,当训练过程明确标记出“拒绝应该让位于回答”的证据层级时,接地选择性问答的效果能够得到显著改善。该研究为构建更实用、更可信的问答系统提供了新的训练思路,尤其适用于对答案可靠性和可验证性要求较高的场景。