2026年9月3日提交至arXiv的一篇论文提出了一个系统性框架,用于理解大语言模型如何利用外部证据。论文由Sebastien Kawada和Manolis Kellis撰写,共114页、16幅图和38张表,并将LLM视为一个有初始答案偏好的“接收者”。作者认为,外部证据会引发模型初始答案分布的整体迁移;迁移的方向和强度由接收者自身的先验权重与候选证据的倾斜方向共同决定。因此,同一个证据在不同模型或不同上下文中的作用可能截然相反。
基于这套分布理论,研究给出三个预测:第一,接收者认为更可能的候选答案具有更强说服力;第二,模型更乐于整合自己容易产生的“特征性错误”,而非来自其他来源的陌生错误;第三,完全相同的证据可能提升较弱模型的表现,同时损害较强模型的表现。这种接收者相对可靠性边界还显示,与模型固有偏好一致的误差对性能的破坏,明显高于同概率的随机误差。团队通过1000万次试验、四个模型家族中的12个LLM以及八个不同领域验证了这些结论;其中量子力学、物理、遗传学和分子生物学属于物理与生命科学中的科学发现任务。
尤其值得警惕的是,模型在接受外部候选答案之前即使已在内部验证其无效,仍然会以极高概率将其整合:在有命题约束的设置中为93%至100%,在保留的物理和生命科学推理问题上最高达99.4%。这说明,证据整合并不是简单地用对来源的标量信任度去覆盖模型判断,而是由接收模型自身分布决定的一种控制策略。
因果干预实验进一步揭示,候选答案整合发生在网络后期,并表现为结构化步骤:先引入外部候选答案,再提升其状态,最后把它迁移到最终答案状态。虽然验证过程的表征在模型内部可以被解码,却对答案几乎没有因果影响;J-lens分解也表明,支持“口头验证”的内部状态与支持“候选整合”的内部状态可以完全分离。这项研究对检索增强生成、多智能体协作以及AI工具调用场景中的错误传播提出了新的风险建模思路。