跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

相同数量,不同答案:语言模型中的数值表示不变性

文章摘要

一篇新论文检验了开放权重语言模型在数值等价改写下的答案一致性:在 3,600 道精确有理数问题和 8,600 条提示上,五个模型的正准准确率高达 0.969–0.996,但同一等值轨道的正确率与不变性降至约 0.85–0.98。研究指出,部分所谓推理失败其实来自评测器的数字语法未覆盖乘法形式的科学计数法;Mistral Small 4 则在单位换算上出现相差整十次幂的系统性错误。另有 9,000 次调用实验显示,表示共识并未优于复述共识,反而产生更多误报。

来源arXiv Computational Linguistics作者: Ephraim Atta-Duncan
相同数量,不同答案:语言模型中的数值表示不变性
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

语言模型在数学推理上的表现,是否会被数字的书写形式左右?arXiv 上新近提交的一篇论文《相同数量,不同答案:语言模型中的数值表示不变性》(Same Quantity, Different Answer: Numerical Representation Invariance in Language Models)由 Ephraim Atta-Duncan 撰写,针对一个看似简单却容易被忽略的问题展开系统评测:当同一道应用题中的数量被改写成数值上完全等价的另一种形式——小数、分数、百分数、数词、科学计数法,或经过精确换算的单位——模型是否仍应给出同一个规范答案。

为回答这个问题,作者构建了 3,600 道精确有理数问题,并在此基础上生成 8,600 条提示,覆盖五个保持数值同一性的变换族。评测对象是五个开放权重系统。论文特别强调,评测流程中先用一套固定的语法审计来归一化常见答案形式,而不依赖大语言模型充当裁判,以避免把格式差异误判为推理差异。

审计之后,各模型的正准答案准确率落在 0.969 至 0.996 之间,看似接近满分。然而,当评测视角从单题正确转向同一等值轨道上的一致性时,轨道正确率下降到 0.848–0.981,轨道不变性则为 0.851–0.981。换句话说,模型往往答对了某一种写法,却无法在等价写法之间保持稳定。值得注意的是,所谓“不变但错误”的轨道最多只占 0.003,说明多数不一致确实来自答案随表示形式而改变。

论文进一步指出,若使用严格的解析器,会出现大面积的“崩塌”,但其中大部分并非真正的推理失败:乘法形式的科学计数法(例如 3×10^5)落在了评测器实现的数字语法之外。作者认为,这一现象说明评测接口本身可能伪装成模型推理能力的缺陷。与此同时,仍存在一类更实质的语义病理:Mistral Small 4 在单位换算输入上的得分仅为 0.699,并产生了 265 个与标签相差恰好整十次幂的错误,提示模型在处理单位尺度时存在系统性问题。

在另一项独立实验中,作者分配 9,000 次调用,使被比较的两个方案获得相同数量的调用预算,以比较“表示共识”与“复述共识”。结果显示,在低错误率子集上,表示共识并未优于复述共识,反而产生了明显更多的误报。这一结果对依赖多次采样投票来提升数值鲁棒性的做法提出了警告。

论文附带一个辅助归档,包含冻结的基准数据、评测与审计记录、共识原始响应、清单文件、分析代码,以及可一键构建论文的流程。论文共 15 页,含 2 张图,归类于计算与语言(cs.CL)与机器学习(cs.LG),提交时间为 2026 年 7 月 27 日。整体来看,这项工作把数值表示不变性从“模型会不会算”的问题,推进为“评测如何定义正确”的问题:在报告推理失败之前,先确认评测器没有把合法的数值写法挡在门外。

展开要点与分析

文章情报

投资人进阶

要点

  • 研究在 3,600 道精确有理数题和 8,600 条提示上评测五个开放权重模型,覆盖五类保持等值的改写。
  • 经过固定语法审计后,正准准确率为 0.969–0.996,但轨道正确率和轨道不变性降至 0.848–0.981 与 0.851–0.981。
  • 严格解析器的大面积失败主要源于乘法形式科学计数法不在数字语法内,说明评测接口可能伪装成推理失败。
  • Mistral Small 4 在单位换算输入上得分 0.699,并出现 265 个与标签相差整十次幂的错误;表示共识未优于复述共识且误报更多。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。