PromptNCE:仅使用LLM和对比估计提示的点互信息预测
arXiv最新论文提出PromptNCE方法,仅通过提示和LLM的概率输出即可零样本估计点互信息(PMI),无需训练专用模型。在三个数据集上达到最高Spearman相关性0.82,并在计算机科学教育中展示了低数据场景下的应用。
在自然语言处理中,点互信息(PMI)是一个核心概念,用于衡量两个事件之间的关联程度。传统上,从文本中估计PMI需要为每个特定任务训练一个专门的模型(称为批评器),这极大地限制了其在数据稀缺场景下的应用。然而,一项来自arXiv的新研究提出了一种名为PromptNCE的方法,它仅利用大语言模型(LLM)和精心设计的提示即可进行零样本的PMI估计,无需任何额外的训练。这项研究由Juliette Woodrow等人完成,并于2026年5月20日公开发布。
PromptNCE的工作原理是将条件概率估计重新构思为一个对比学习任务。具体来说,它向候选集合中添加一个明确的“OTHER”类别,并利用LLM的输出概率来估计PMI。研究者从理论上证明了,通过添加OTHER类别,模型能够恢复真实的概率分布,而不仅仅是得到一组候选的相对排序。这一理论突破使得对比提示可以作为一种通用的零样本概率估计工具。为了验证该方法,研究人员构建了一个包含人类判断的真实PMI基准,该基准涵盖了三个公开的数据集。在实验中,他们对五种基于信息论提示的估计器进行了评估。结果一致显示,PromptNCE在所有三个数据集上均取得了最优的零样本性能,其与人类真实PMI之间的Spearman相关系数最高达到0.82,远高于其他基线方法。这充分证明了PromptNCE在无训练情况下估计PMI的准确性和鲁棒性。
除了在基准上的出色表现,论文还通过一个计算机科学教育的案例研究展示了PromptNCE的实用价值。在这个案例中,研究人员利用PromptNCE对学生提交的知识摘要进行自动评分。由于教育场景中往往缺乏大规模的标注数据,传统的监督学习方法难以直接应用。而PromptNCE凭借其零样本特性,仅需少量提示即可有效评估学生的理解程度,为低资源教育环境下的自动评估提供了可行的解决方案。
总而言之,PromptNCE通过巧妙地设计对比提示并引入OTHER类别,成功实现了零样本的PMI估计,并在多个数据集上取得了令人瞩目的成果。这项工作不仅为信息论度量在自然语言处理中的应用提供了新方法,也为利用LLM进行概率估计开辟了新方向,尤其是在数据有限的领域具有巨大的应用潜力。