arXiv 于 2026 年 9 月 20 日收录了一篇题为《The Probabilistic Structure of Large Language Models》(大语言模型的概率结构)的论文,作者为 Adnan Aboulalaâ,编号 arXiv:2609.25134v1,属于 cs.LG(机器学习)分类,并交叉列出 cs.AI(人工智能)、math.PR(概率论)与 stat.ML(统计机器学习),MSC 分类号包括 60J10、60J60、62F10,以及次级的 60H10、94A17、68T50。论文为综述/阐释性(expository)文章,共 27 页,提交时间为 2026 年 9 月 20 日 21:53:57 UTC。
文章的核心动机是「整合」。作者指出,关于大语言模型的概率论工具在既有文献中往往被分散讨论,因此他希望用一份自成体系(self-contained)的叙述把它们汇聚到同一个框架下。在这一框架中,大语言模型被描述为定义在 token 序列集合上的概率测度,而这些测度由模型的自回归条件分布逐项指定。换言之,模型并不是一个从输入到输出的确定性函数,而是一个在序列空间上分布的随机对象。
在此基础上,训练与生成获得了统一的概率解释。训练被形式化为最大似然估计问题,并通过随机梯度类方法求解;文本生成则被看作对所得随机过程的序贯模拟——每一步从条件分布中采样,逐步展开成完整序列。这种表述把「学习」与「采样」放进同一个概率模型的两端,也让许多工程实践中的近似与偏差可以被更清楚地定位。
论文特别考察了 Kullback–Leibler 散度的不对称性在文本生成中的作用。由于 KL 散度并非对称度量,前向与反向两种方向在优化与评估中会导致不同的行为倾向,作者将其与幻觉(hallucination)等典型现象联系起来,并进一步讨论了「统计上合理」与「事实上为真」这两件事之间的区别:模型被优化的目标是拟合数据分布,而不是保证所述内容为真。这一区分对于理解大语言模型的可靠性边界具有重要意义。
作为同一概率视角的补充例证,文章还讨论了扩散模型。扩散模型围绕 score function 构建,它并不把生成理解为逐 token 的序贯预测,而是把它理解为对逆时间随机过程的模拟:从噪声出发,反向演化到数据分布。作者指出,这种视角在离散时间与连续时间两种设定下都成立,从而与自回归语言模型的概率描述形成对照,显示出两类生成模型可以在同一个概率论语言中被并列讨论。