跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

大語言模型的機率結構:一篇自洽的機率論綜述

文章摘要

arXiv 上新發布的一篇 27 頁綜述性論文《The Probabilistic Structure of Large Language Models》由 Adnan Aboulalaâ 撰寫,試圖用統一的機率論框架描述大語言模型:把模型視為 token 序列上的機率測度,把訓練視為最大似然估計,把生成視為隨機過程的序貫模擬,並借 KL 散度的不對稱性解釋幻覺以及「統計上合理」與「真實」之間的區別。文章還以擴散模型作為同一視角的補充例證。

來源arXiv Machine Learning作者: Adnan Aboulala\^a
大語言模型的機率結構:一篇自洽的機率論綜述
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

arXiv 於 2026 年 9 月 20 日收錄了一篇題為《The Probabilistic Structure of Large Language Models》(大語言模型的機率結構)的論文,作者為 Adnan Aboulalaâ,編號 arXiv:2609.25134v1,屬於 cs.LG(機器學習)分類,並交叉列出 cs.AI(人工智慧)、math.PR(機率論)與 stat.ML(統計機器學習),MSC 分類號包括 60J10、60J60、62F10,以及次級的 60H10、94A17、68T50。論文為綜述/闡釋性(expository)文章,共 27 頁,提交時間為 2026 年 9 月 20 日 21:53:57 UTC。

文章的核心動機是「整合」。作者指出,關於大語言模型的機率論工具在既有文獻中往往被分散討論,因此他希望用一份自成體系(self-contained)的敘述把它們匯聚到同一個框架下。在這一框架中,大語言模型被描述為定義在 token 序列集合上的機率測度,而這些測度由模型的自迴歸條件分佈逐項指定。換言之,模型並不是一個從輸入到輸出的確定性函式,而是一個在序列空間上分佈的隨機物件。

在此基礎上,訓練與生成獲得了統一的機率解釋。訓練被形式化為最大似然估計問題,並透過隨機梯度類方法求解;文本生成則被看作對所得隨機過程的序貫模擬——每一步從條件分佈中取樣,逐步展開成完整序列。這種表述把「學習」與「取樣」放進同一個機率模型的兩端,也讓許多工程實踐中的近似與偏差可以被更清楚地定位。

論文特別考察了 Kullback–Leibler 散度的不對稱性在文本生成中的作用。由於 KL 散度並非對稱度量,前向與反向兩種方向在最佳化與評估中會導致不同的行為傾向,作者將其與幻覺(hallucination)等典型現象聯絡起來,並進一步討論了「統計上合理」與「事實上為真」這兩件事之間的區別:模型被最佳化的目標是擬合資料分佈,而不是保證所述內容為真。這一區分對於理解大語言模型的可靠性邊界具有重要意義。

作為同一機率視角的補充例證,文章還討論了擴散模型。擴散模型圍繞 score function 構建,它並不把生成理解為逐 token 的序貫預測,而是把它理解為對逆時間隨機過程的模擬:從噪聲出發,反向演化到資料分佈。作者指出,這種視角在離散時間與連續時間兩種設定下都成立,從而與自迴歸語言模型的機率描述形成對照,顯示出兩類生成模型可以在同一個機率論語言中被並列討論。

展開要點與分析

文章情報

工程師進階

要點

  • 論文將大語言模型形式化為 token 序列空間上的機率測度,由其自迴歸條件分佈確定。
  • 訓練被表述為最大似然估計問題,用隨機梯度方法求解;文本生成則是對應隨機過程的序貫模擬。
  • 作者用 KL 散度的不對稱性討論幻覺現象,以及統計合理性與真實性之間的區別。
  • 文章還以基於 score function 的擴散模型作為同一機率視角的補充,將生成理解為把噪聲變換為資料的逆時間隨機過程模擬。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。