AI News HubLIVE
站内改写1 分钟阅读

相同问题,不同答案:超越准确率评估LLM可靠性

研究表明,大型语言模型(LLM)在基准测试中常获高准确率,但当同一问题以不同但等价的方式表述时,其答案可能改变。研究涵盖四个基准和13个模型,发现实例级行为不稳定,不匹配率超过23%。模型虽常有正确知识但检索不一致,自释义策略可部分恢复潜在知识并提升性能。

来源arXiv AI作者: Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

近日,arXiv上发布了一篇来自Kazem Faghih等六位作者的论文(编号2607.22554),该论文深入探讨了大型语言模型(LLM)的可靠性问题。研究指出,虽然LLM在标准基准测试中往往表现出高准确率,但当同一问题以不同但语义等价的措辞提出时,模型的回答可能会发生变化,这引发了对其实际可靠性的质疑。

研究团队在四个基准测试上评估了13个模型,这些测试涵盖事实问答和数学推理任务。他们通过生成意义保持的释义文本来观察模型答案的变化。结果显示,虽然整体准确率在不同释义之间变化不大,但个体实例的行为却极不稳定。对于许多问题,模型根据措辞的不同在正确与错误答案之间摇摆,不匹配率高达23%以上。特别值得注意的是,当仅考虑原始措辞答对的问题时,答案翻转率甚至更高,这表明单一提示的正确性远非衡量可靠性的可靠指标。

有趣的是,研究人员发现,模型通常能对至少一种释义给出正确答案。这暗示着相关知识实际上存储在模型中,但无法被一致地检索出来。基于这一观察,他们提出了一种简单的“自释义”策略:在推理时,让模型对同一问题生成多种释义,然后聚合所有答案。实验证明,这种方法能够部分恢复潜在知识,从而提升整体性能。

该研究的结论强调,标准准确率指标可能掩盖了LLM内在的不稳定性。要更清晰地评估LLM的可靠性,需要考察模型在等价输入上的一致性表现。这项工作为未来LLM的评估和部署提供了重要的参考,提醒我们在依赖模型输出前必须关注其在不同措辞下的稳定性。