开放式问答中推理的无参考评估
提出一种基于推理的无参考框架,通过NLI和超图结构审计LLM推理轨迹,在数学和医疗推理中比直接使用LLM评判更可靠。
来源arXiv Computational Linguistics作者: Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull, Gregory E Dean, Maria Liakata
在人工智能生成内容日益普及的今天,特别是在医疗、法律等高 stakes 领域,如何验证AI回答的推理过程是否可靠成为一个关键挑战。传统方法往往依赖于参考答案或使用大型语言模型(LLM)本身作为评判者,但这两种方式都存在局限性:参考标准可能不存在,而LLM评判者容易接受流畅但实际依据不足的回复。
近日,来自Guneet Singh Kohli等研究人员的论文提出了一种全新的无参考评估框架,专门用于审计LLM生成的多步推理过程。该方法首先将推理轨迹分解为多个片段,然后利用自然语言推理(NLI)技术标记每个片段与结论之间的前提-目标关系,并将这些关系组织成超图结构。最后,通过确定性的后向AND-OR搜索,为每个片段分配审计标签,指明其在整体推理中的基础依据。
研究者在两个场景中评估了该框架:数学演绎推理(使用Hard2Verify数据集)和开放式医疗推理。针对医疗场景,他们构建了一个新的基准数据集UroReason,包含由医生标注的真实临床病例中LLM的推理轨迹。实验结果显示,基于NLI的超图审计方法比直接使用LLM作为评判者提供了更可靠的参考评估信号。特别值得一提的是,在医疗案例中,当前最先进的LLM评判者经常无法识别有问题的推理片段,过度接受那些流畅但推理薄弱的回答。这一发现揭示了仅依赖最终答案或单一LLM验证者的固有缺陷,表明评估应当考虑整个推理轨迹中推断关系的组合方式。
该框架的代码将开源发布,UroReason数据集也将通过API提供。该研究为构建更可信的AI系统提供了新的视角和工具,对模型选型、推理成本优化以及产品能力评估等方面都可能产生深远影响。