言語モデルの数学的推論は、数の書き方に左右されるのだろうか。arXiv に新たに投稿された論文「同じ量、異なる答え:言語モデルにおける数値表現不変性」(Same Quantity, Different Answer: Numerical Representation Invariance in Language Models)は、Ephraim Atta-Duncan 氏によるもので、一見単純だが見過ごされがちなこの問いを体系的に検証している。すなわち、同じ文章題に含まれる数量が、小数、分数、百分率、数詞、科学表記法、あるいは正確に換算された単位といった数値的に等価な別の形式で書かれても、モデルは同じ正準解を返すべきだ、という前提である。
この問いに答えるため、著者は 3,600 の厳密有理数問題を生成し、そこから 5 つの同一性保存変換ファミリーにまたがる 8,600 のプロンプトを作成した。評価対象は 5 つのオープンウェイトシステムである。論文は特に、LLM を審判に使わず、固定された構文監査によって一般的な解答形式を正規化してから評価する点を強調している。これにより、形式の違いを推論の違いと誤って判定することを避けている。
監査後の正準精度は 0.969 から 0.996 に収まり、一見ほぼ満点に見える。しかし、単一問題の正解から同じ等価オービット上の一貫性へと評価の視点を移すと、オービット正解率は 0.848–0.981 に、オービット不変性は 0.851–0.981 に低下する。つまり、モデルはある書き方では正解しても、等価な書き方の間で安定しないことが多い。なお、「不変だが誤り」のオービットは最大でも 0.003 にとどまり、不一致の多くは実際に表現形式によって答えが変わることに由来する。
論文はさらに、厳格なパーサーを使うと大規模な「崩壊」が生じるものの、その大部分は本当の推論失敗ではないと指摘する。乗算形の科学表記法(例:3×10^5)が、評価器に実装された数値文法の外にあるためである。著者らは、この現象が評価インターフェースそのものをモデルの推論能力の欠陥に見せかける可能性を示していると述べる。一方で、より本質的な意味論的病理も残る。Mistral Small 4 は単位変換入力で 0.699 にとどまり、ラベルとちょうど 10 の冪だけ異なる 265 件の誤りを生じさせており、単位スケールの扱いに体系的な問題があることを示唆している。
別の独立した実験では、9,000 回の呼び出しを比較対象の 2 つのアームに均等に配分し、「表現コンセンサス」と「言い換えコンセンサス」を比較した。その結果、低誤り率のサブセットでは表現コンセンサスは言い換えコンセンサスを上回らず、むしろ誤警報を大幅に増やした。この結果は、複数回サンプリングによる投票で数値的頑健性を高めようとする手法に警告を与えている。
論文には補助アーカイブが付属し、凍結されたベンチマーク、評価と監査の記録、コンセンサスの生応答、マニフェスト、分析コード、そしてワンコマンドで論文をビルドする仕組みが含まれている。論文は 15 ページ、図 2 点で、計算と言語(cs.CL)および機械学習(cs.LG)に分類され、2026 年 7 月 27 日に提出された。全体としてこの研究は、数値表現の不変性を「モデルが計算できるか」という問題から、「評価が正しさをどう定義するか」という問題へと押し進めている。推論失敗を報告する前に、評価器が正当な数値表現を締め出していないかを確認すべきだ、というわけである。