AI News HubLIVE
站内改写2 分钟阅读

在黑盒大语言模型中通过逐步骤置信度归因诊断多步推理失败

本文提出步骤置信度归因(SCA)框架,用于黑盒大语言模型的多步推理诊断。基于信息瓶颈原理,通过分析推理轨迹中的一致性,自动标记低置信步骤。实验表明,该方法能有效识别与推理错误高度相关的步骤,并提升自我纠错成功率高达13.5%。

来源arXiv Computational Linguistics作者: Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei

大型语言模型(Large Language Models, LLMs)在客观答案推理任务中通过生成逐步解决方案表现出色,例如数学问题求解和多跳问答。然而,诊断多步推理链条中的故障点仍然是一个难题。尽管置信度估计提供了一种诊断信号,但现有方法要么局限于最终答案的置信度,要么需要访问模型的内部状态(如logits或注意力权重),这对于闭源或黑盒模型来说是不可行的。

为了解决这一挑战,来自学术界的研究团队提出了步骤置信度归因(Stepwise Confidence Attribution, SCA)框架,专门针对闭源LLM设计。SCA的核心创新在于,它仅基于模型生成的推理轨迹(即每一步的文本输出)来分配步骤级别的置信度,无需任何内部模型访问。该框架应用了信息瓶颈(Information Bottleneck, IB)原理:如果一个推理步骤与正确解决方案中的共识结构相一致,则获得高置信度;如果偏离共识,则被标记为潜在错误。

具体来说,研究者提出了两种互补的方法实现SCA。第一种是非参数信息瓶颈(Non-parametric Information Bottleneck, NIBS),它通过测量推理轨迹之间的语义一致性来估计置信度,无需依赖图结构。第二种是基于图的信息瓶颈(Graph-based Information Bottleneck, GIBS),它通过一个可微分掩码学习子图,从而捕捉推理步骤之间的逻辑变异性。这两种方法互为补充,NIBS适用于缺乏明显结构关系的推理场景,而GIBS能更精细地建模步骤间的依赖关系。

研究者在大规模数学推理和多跳问答数据集上进行了大量实验。结果表明,SCA能够可靠地识别出低置信度步骤,这些步骤与实际的推理错误高度相关。更重要的是,当使用步骤级置信度来引导模型进行自我纠正时,纠正成功率相比于仅使用答案级反馈提升了高达13.5%。这一发现表明,步骤级的诊断信号对于提升LLM的推理可靠性具有重要价值。

该研究已被国际机器学习大会(ICML 2026)接收,标志着在可解释AI和黑盒模型诊断领域的重要进展。步骤置信度归因框架为理解和改进大语言模型的推理能力提供了新的工具,尤其适用于那些无法访问内部参数的商业模型。未来,该方法有望集成到产品级别的LLM系统中,帮助开发者快速定位推理错误,并提升模型的稳健性和可信度。