AI News HubLIVE
站内改写1 分钟阅读

大型语言模型的概率归因

该论文提出了一种模型无关的概率性令牌归因方法,利用贝叶斯规则反转下一令牌的对数概率,以捕捉大型语言模型内部对标记序列分布的表示,并通过熵和归因分数之间的关系揭示模型行为。

来源arXiv Computational Linguistics作者: Shilpika Shilpika, Carlo Graziani, Bethany Lusch, Venkatram Vishwanath, Michael E. Papka

一篇发表于arXiv上的新论文《Probabilistic Attribution For Large Language Models》提出了一种创新的概率归因方法,用于解释大型语言模型(LLM)的生成行为。该方法的核心思想是将LLM视为一个随机过程,利用模型在生成每个令牌时计算的条件概率。通过贝叶斯规则反转下一令牌的对数概率,研究人员能够捕捉模型内部对令牌序列分布的表示,这种表示独立于模型的具体计算结构。

具体而言,该表示可以计算在给定提示下响应的条件概率,以及当某个令牌被边缘化(即去除)后的响应概率。归因分数定义为这两个概率比值的对数。此外,研究还计算了单个提示的令牌分布熵,该熵受上下文影响。熵与归因分数之间的相互作用揭示了LLM行为的深层规律,例如模型在不同令牌上的不确定性和稳定性。

实验部分,研究者在7个不同的提示上评估了8个不同的模型,涵盖了从GPT、LLaMA到其他开源模型的广泛范围。他们分析了异常现象、令牌敏感性、响应稳定性、模型稳定性以及训练收敛性。结果表明,该方法能够有效提升模型的可解释性,帮助用户识别生成过程中不确定或不稳定的部分,从而更好地调试和信任LLM。

该论文还讨论了归因分数如何揭示模型对特定令牌的依赖关系,以及熵如何指示模型在生成过程中的不确定性。这些发现为理解LLM的行为机理提供了新的视角,并为未来开发更可靠的AI系统奠定了基础。论文共29页,包含13张图表,由5位作者共同完成,投稿至arXiv并于2026年5月20日发布。