AI News HubLIVE
站内改写2 分钟阅读

大型语言模型的信息辨别能力

一项新研究揭示了大型语言模型(LLM)在整合外部信息时存在显著缺陷:它们几乎无法区分可靠与不可靠的来源,对信息真实性的判断也接近随机水平。研究引入了Learn2Discern框架,通过对13个模型、近67万次试验的测试,发现模型更倾向于依赖来源的流行度而非可靠性,并且无论信息是否接近真相,其更新程度几乎相同。用户调查(n=299)证实,这些缺陷会降低用户信任和使用意愿。研究还提出了一些简单的推理时干预措施,可部分改善信息辨别能力。

来源arXiv AI作者: Joshua Ashkinaze, Laura Kurek, Alina Faisal, Tongyuan Miao, Mariam Joseph, Ceren Budak, Eric Gilbert

大型语言模型(LLM)正被越来越多地用于从互联网等外部来源整合知识,但它们能否恰当评估信息的可靠性?这是亚利桑那大学和微软研究院研究团队在一篇新论文中探讨的核心问题。他们正式定义了“信息辨别”概念,并推出了Learn2Discern(L2D)框架。该框架基于三条规范公理,配有可解释的指标,旨在量化模型在来源辨别(是否更信任可靠来源)和真相辨别(是否根据事实更新信念)两个维度上的表现。为了验证这些公理的外部有效性,研究团队进行了一项预先注册、配额匹配的用户调查(n=299)。结果显示,真实的LLM用户普遍认可所有三条公理,并报告说如果模型违反这些公理,他们的信任和使用意愿会显著降低。

在对13个主流模型(包括GPT-4、Claude、Llama系列等)进行的近67万次系统试验中,研究人员发现了持续且显著的失败模式。在来源辨别任务上,模型对来源流行度的依赖程度几乎是来源可靠性的两倍,这意味着它们更容易被广泛传播的信息影响,而非来自权威来源的信息。在真相辨别任务上,模型的表现接近随机水平:无论一条声明是使模型的先验更接近真实还是更远离真实,模型更新的幅度几乎相同。值得注意的是,模型在自身先验已经最准确的数据集上整合外部知识的效果最好,这暗示模型可能更倾向于确认自己的已有知识,而非真正学习和修正。

研究还发现,尽管较新和较大的模型在真相辨别能力上有所提升,但来源辨别能力并未随之改善,这表明模型复杂性的增加并不能自动解决这一盲点。为了应对这些挑战,研究人员提出了一些简单的推理时干预措施,例如修改提示词或对输出进行后处理,这些措施能同时改善两种辨别能力。研究人员强调,随着LLM逐步取代传统搜索引擎成为信息获取的主要途径,信息辨别这一核心对齐属性的重要性将日益凸显。他们已经公开了此次研究使用的数据集和调查问卷,作为测试基准供学术界和工业界进一步研究和评估。该论文于2026年5月22日提交至arXiv,主题涵盖人工智能、计算语言学以及计算机与社会等领域。