跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

相同數量,不同答案:語言模型中的數值表示不變性

文章摘要

一篇新論文檢驗了開放權重語言模型在數值等價改寫下的答案一致性:在 3,600 道精確有理數問題和 8,600 條提示上,五個模型的正準準確率高達 0.969–0.996,但同一等值軌道的正確率與不變性降至約 0.85–0.98。研究指出,部分所謂推理失敗其實來自評測器的數字語法未覆蓋乘法形式的科學計數法;Mistral Small 4 則在單位換算上出現相差整十次冪的系統性錯誤。另有 9,000 次調用實驗顯示,表示共識並未優於複述共識,反而產生更多誤報。

來源arXiv Computational Linguistics作者: Ephraim Atta-Duncan
相同數量,不同答案:語言模型中的數值表示不變性
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

語言模型在數學推理上的表現,是否會被數字的書寫形式左右?arXiv 上新近提交的一篇論文《相同數量,不同答案:語言模型中的數值表示不變性》(Same Quantity, Different Answer: Numerical Representation Invariance in Language Models)由 Ephraim Atta-Duncan 撰寫,針對一個看似簡單卻容易被忽略的問題展開系統評測:當同一道應用題中的數量被改寫成數值上完全等價的另一種形式——小數、分數、百分數、數詞、科學計數法,或經過精確換算的單位——模型是否仍應給出同一個規範答案。

為回答這個問題,作者構建了 3,600 道精確有理數問題,並在此基礎上生成 8,600 條提示,覆蓋五個保持數值同一性的變換族。評測對象是五個開放權重系統。論文特別強調,評測流程中先用一套固定的語法審計來歸一化常見答案形式,而不依賴大語言模型充當裁判,以避免把格式差異誤判為推理差異。

審計之後,各模型的正準答案准確率落在 0.969 至 0.996 之間,看似接近滿分。然而,當評測視角從單題正確轉向同一等值軌道上的一致性時,軌道正確率下降到 0.848–0.981,軌道不變性則為 0.851–0.981。換句話説,模型往往答對了某一種寫法,卻無法在等價寫法之間保持穩定。值得注意的是,所謂“不變但錯誤”的軌道最多隻佔 0.003,説明多數不一致確實來自答案隨表示形式而改變。

論文進一步指出,若使用嚴格的解析器,會出現大面積的“崩塌”,但其中大部分並非真正的推理失敗:乘法形式的科學計數法(例如 3×10^5)落在了評測器實現的數字語法之外。作者認為,這一現象説明評測接口本身可能偽裝成模型推理能力的缺陷。與此同時,仍存在一類更實質的語義病理:Mistral Small 4 在單位換算輸入上的得分僅為 0.699,併產生了 265 個與標籤相差恰好整十次冪的錯誤,提示模型在處理單位尺度時存在系統性問題。

在另一項獨立實驗中,作者分配 9,000 次調用,使被比較的兩個方案獲得相同數量的調用預算,以比較“表示共識”與“複述共識”。結果顯示,在低錯誤率子集上,表示共識並未優於複述共識,反而產生了明顯更多的誤報。這一結果對依賴多次採樣投票來提升數值魯棒性的做法提出了警告。

論文附帶一個輔助歸檔,包含凍結的基準數據、評測與審計記錄、共識原始響應、清單文件、分析代碼,以及可一鍵構建論文的流程。論文共 15 頁,含 2 張圖,歸類於計算與語言(cs.CL)與機器學習(cs.LG),提交時間為 2026 年 7 月 27 日。整體來看,這項工作把數值表示不變性從“模型會不會算”的問題,推進為“評測如何定義正確”的問題:在報告推理失敗之前,先確認評測器沒有把合法的數值寫法擋在門外。

展開要點與分析

文章情報

投資人進階

要點

  • 研究在 3,600 道精確有理數題和 8,600 條提示上評測五個開放權重模型,覆蓋五類保持等值的改寫。
  • 經過固定語法審計後,正準準確率為 0.969–0.996,但軌道正確率和軌道不變性降至 0.848–0.981 與 0.851–0.981。
  • 嚴格解析器的大面積失敗主要源於乘法形式科學計數法不在數字語法內,説明評測接口可能偽裝成推理失敗。
  • Mistral Small 4 在單位換算輸入上得分 0.699,並出現 265 個與標籤相差整十次冪的錯誤;表示共識未優於複述共識且誤報更多。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。