跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

大语言模型中的证据整合

文章摘要

这项研究提出,LLM并非被动接受外部证据,而是基于自身先验分布对候选答案进行选择性整合。实验横跨1000万次测试、12个LLM和8个领域,发现证据与模型已有倾向越一致越容易被采纳;相同证据可能使弱模型变好而让强模型变差,甚至可能在模型内部已判定证据无效时仍被整合。

来源arXiv Computational Linguistics作者: Sebastien Kawada, Manolis Kellis
大语言模型中的证据整合
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

2026年9月3日提交至arXiv的一篇论文提出了一个系统性框架,用于理解大语言模型如何利用外部证据。论文由Sebastien Kawada和Manolis Kellis撰写,共114页、16幅图和38张表,并将LLM视为一个有初始答案偏好的“接收者”。作者认为,外部证据会引发模型初始答案分布的整体迁移;迁移的方向和强度由接收者自身的先验权重与候选证据的倾斜方向共同决定。因此,同一个证据在不同模型或不同上下文中的作用可能截然相反。

基于这套分布理论,研究给出三个预测:第一,接收者认为更可能的候选答案具有更强说服力;第二,模型更乐于整合自己容易产生的“特征性错误”,而非来自其他来源的陌生错误;第三,完全相同的证据可能提升较弱模型的表现,同时损害较强模型的表现。这种接收者相对可靠性边界还显示,与模型固有偏好一致的误差对性能的破坏,明显高于同概率的随机误差。团队通过1000万次试验、四个模型家族中的12个LLM以及八个不同领域验证了这些结论;其中量子力学、物理、遗传学和分子生物学属于物理与生命科学中的科学发现任务。

尤其值得警惕的是,模型在接受外部候选答案之前即使已在内部验证其无效,仍然会以极高概率将其整合:在有命题约束的设置中为93%至100%,在保留的物理和生命科学推理问题上最高达99.4%。这说明,证据整合并不是简单地用对来源的标量信任度去覆盖模型判断,而是由接收模型自身分布决定的一种控制策略。

因果干预实验进一步揭示,候选答案整合发生在网络后期,并表现为结构化步骤:先引入外部候选答案,再提升其状态,最后把它迁移到最终答案状态。虽然验证过程的表征在模型内部可以被解码,却对答案几乎没有因果影响;J-lens分解也表明,支持“口头验证”的内部状态与支持“候选整合”的内部状态可以完全分离。这项研究对检索增强生成、多智能体协作以及AI工具调用场景中的错误传播提出了新的风险建模思路。

展开要点与分析

文章情报

工程师中级

要点

  • 外部证据会使模型对初始答案的概率分布发生迁移,而不是作为可信度标量被直接采纳。
  • 在12个LLM、1000万次试验中,模型更倾向于整合与自己特征性错误一致的证据。
  • 即使内部验证出候选无效,模型仍有93%到100%的概率将其整合,验证状态对最终答案几乎无因果影响。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。