2026年9月20日、arXiv に「The Probabilistic Structure of Large Language Models(大規模言語モデルの確率的構造)」と題する論文が公開された。著者は Adnan Aboulalaâ で、識別子は arXiv:2609.25134v1、分類は cs.LG(機械学習)であり、cs.AI(人工知能)、math.PR(確率論)、stat.ML(統計的機械学習)がクロスリストされている。MSC 分類には 60J10、60J60、62F10 が主分類として、60H10、94A17、68T50 が副分類として挙げられている。本論文は解説(expository)を目的とした27ページの記事で、投稿日時は 2026年9月20日 21:53:57 UTC である。
論文の中心的な狙いは「統合」にある。著者は、大規模言語モデルをめぐる確率論的な道具立てが従来の文献では別々に扱われがちであることを指摘し、それらを一つの自己完結した記述へとまとめ上げようとしている。この枠組みでは、大規模言語モデルはトークン列の集合上に定義された確率測度として記述され、その測度はモデルの自己回帰的な条件付き分布によって指定される。つまりモデルは入力から出力への決定論的な関数ではなく、系列空間上の確率的な対象として捉えられる。
この見方の上では、学習と生成が同じ確率論的な言葉で説明される。学習は最尤推定問題として定式化され、確率的勾配法の系統によって解かれる。一方、テキスト生成は、こうして得られた確率過程を逐次的にシミュレーションすること、すなわち各ステップで条件付き分布からサンプリングし、系列を順に展開していくことだとみなされる。こうした定式化により、学習とサンプリングが同一の確率モデルの両端に位置づけられ、実務における近似や偏りをより明確に位置づけられるようになる。
論文はとりわけ、テキスト生成における Kullback–Leibler ダイバージェンスの非対称性の役割を検討している。KL ダイバージェンスは対称な距離ではないため、順方向と逆方向では最適化や評価の挙動が異なってくる。著者はこれをハルシネーションなどの典型的な現象と関連づけ、さらに「統計的に尤もらしいこと」と「事実として真であること」の区別について論じる。モデルはデータ分布への適合を目的として最適化されており、記述内容の真偽を保証しているわけではない。この区別は、大規模言語モデルの信頼性の限界を理解する上で重要な意味を持つ。
同じ確率的視点の補足的な例として、論文は拡散モデルも取り上げる。拡散モデルはスコア関数を中心に構成され、生成をトークンの逐次予測としてではなく、逆時間の確率過程のシミュレーションとして捉える。すなわちノイズから出発し、データ分布へと逆向きに時間発展させるのである。著者はこの見方が離散時間と連続時間の双方で成り立つことを示し、自己回帰的な言語モデルの確率論的記述と対比させている。これにより、二種類の生成モデルが同一の確率論の言語の中で並べて論じられることが示される。