跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

大语言模型的概率结构:一篇自洽的概率论综述

文章摘要

arXiv 上新发布的一篇 27 页综述性论文《The Probabilistic Structure of Large Language Models》由 Adnan Aboulalaâ 撰写,试图用统一的概率论框架描述大语言模型:把模型视为 token 序列上的概率测度,把训练视为最大似然估计,把生成视为随机过程的序贯模拟,并借 KL 散度的不对称性解释幻觉以及「统计上合理」与「真实」之间的区别。文章还以扩散模型作为同一视角的补充例证。

来源arXiv Machine Learning作者: Adnan Aboulala\^a
大语言模型的概率结构:一篇自洽的概率论综述
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

arXiv 于 2026 年 9 月 20 日收录了一篇题为《The Probabilistic Structure of Large Language Models》(大语言模型的概率结构)的论文,作者为 Adnan Aboulalaâ,编号 arXiv:2609.25134v1,属于 cs.LG(机器学习)分类,并交叉列出 cs.AI(人工智能)、math.PR(概率论)与 stat.ML(统计机器学习),MSC 分类号包括 60J10、60J60、62F10,以及次级的 60H10、94A17、68T50。论文为综述/阐释性(expository)文章,共 27 页,提交时间为 2026 年 9 月 20 日 21:53:57 UTC。

文章的核心动机是「整合」。作者指出,关于大语言模型的概率论工具在既有文献中往往被分散讨论,因此他希望用一份自成体系(self-contained)的叙述把它们汇聚到同一个框架下。在这一框架中,大语言模型被描述为定义在 token 序列集合上的概率测度,而这些测度由模型的自回归条件分布逐项指定。换言之,模型并不是一个从输入到输出的确定性函数,而是一个在序列空间上分布的随机对象。

在此基础上,训练与生成获得了统一的概率解释。训练被形式化为最大似然估计问题,并通过随机梯度类方法求解;文本生成则被看作对所得随机过程的序贯模拟——每一步从条件分布中采样,逐步展开成完整序列。这种表述把「学习」与「采样」放进同一个概率模型的两端,也让许多工程实践中的近似与偏差可以被更清楚地定位。

论文特别考察了 Kullback–Leibler 散度的不对称性在文本生成中的作用。由于 KL 散度并非对称度量,前向与反向两种方向在优化与评估中会导致不同的行为倾向,作者将其与幻觉(hallucination)等典型现象联系起来,并进一步讨论了「统计上合理」与「事实上为真」这两件事之间的区别:模型被优化的目标是拟合数据分布,而不是保证所述内容为真。这一区分对于理解大语言模型的可靠性边界具有重要意义。

作为同一概率视角的补充例证,文章还讨论了扩散模型。扩散模型围绕 score function 构建,它并不把生成理解为逐 token 的序贯预测,而是把它理解为对逆时间随机过程的模拟:从噪声出发,反向演化到数据分布。作者指出,这种视角在离散时间与连续时间两种设定下都成立,从而与自回归语言模型的概率描述形成对照,显示出两类生成模型可以在同一个概率论语言中被并列讨论。

展开要点与分析

文章情报

工程师进阶

要点

  • 论文将大语言模型形式化为 token 序列空间上的概率测度,由其自回归条件分布确定。
  • 训练被表述为最大似然估计问题,用随机梯度方法求解;文本生成则是对应随机过程的序贯模拟。
  • 作者用 KL 散度的不对称性讨论幻觉现象,以及统计合理性与真实性之间的区别。
  • 文章还以基于 score function 的扩散模型作为同一概率视角的补充,将生成理解为把噪声变换为数据的逆时间随机过程模拟。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。