AI News HubLIVE
站内改写1 分钟阅读

使用GraphEval评估语言模型幻觉

GraphEval是一种利用知识图谱检测和定位大型语言模型(LLM)输出中幻觉的评估框架。本文通过一个轻量级的模拟代码示例,展示了GraphEval的两阶段流程:从模型响应中构建知识图谱,然后使用自然语言推理(NLI)模型评估每个三元组是否与源上下文相矛盾,若无法被蕴含则标记为幻觉。

来源KDnuggets作者: Iván Palomares Carrascosa

大型语言模型(LLM)在生成响应时,常出现“幻觉”问题,即产生事实错误、无意义或凭空捏造的内容。尽管近年来涌现出许多应对幻觉的方法,但用于内部诊断的系统性评估框架相对较少。亚马逊研究人员近期提出了一种基于知识图谱的评估框架——GraphEval,旨在分析和检测LLM中的幻觉。

GraphEval的核心思想是利用知识图谱来识别和标记LLM输出中的幻觉。与传统的性能指标(如准确率)不同,它采用两阶段评估流程,强调可解释性,即揭示幻觉发生的具体位置。第一阶段,从模型生成的响应中构建知识图谱,该图由语义三元组(主体,关系,客体)组成,其中主体和客体为节点,关系为连接节点的边。第二阶段,使用自然语言推理(NLI)模型,将每个三元组与源上下文(即真实知识库)进行比对。任何无法被上下文蕴含(即矛盾或中性)的三元组均被标记为幻觉。

为了更直观地理解GraphEval的工作原理,本文提供了一个轻量级模拟代码示例。该示例避免了实际应用中高昂的计算开销,通过模拟知识图谱提取和NLI评估过程来演示整个流程。在示例中,我们首先定义了真实上下文(即关于GraphEval的准确描述),然后假设LLM生成了一个包含幻觉的响应:“GraphEval需要昂贵的、企业级的服务器群才能运行”。接下来,我们模拟从该响应中提取三元组,包括正确的三元组(如“GraphEval是一种评估框架”)和幻觉三元组(即关于服务器群的要求)。随后,使用预训练的NLI模型(cross-encoder/nli-deberta-v3-small)评估每个三元组与源上下文的关系。结果显示,正确的三元组被判定为“蕴含”(即真实上下文支持它们),而幻觉三元组被判定为“中性”,从而被标记为幻觉。

最后,示例还通过可视化方式展示了知识图谱,其中绿色边表示真实的三元组,红色边表示幻觉三元组,直观呈现了评估结果。

GraphEval框架为检测和定位LLM输出中的幻觉根源提供了一种富有前景的方法。它在生产系统中的应用潜力巨大,尤其是在检索增强生成(RAG)等场景中,能够帮助开发者更有效地识别和修正幻觉问题。