这篇来自 arXiv 的论文(arXiv:2609.22478v1,cs.AI、cs.CL、cs.LG)由 Bhushan Kashinath Joshi 于 2026 年 9 月 18 日提交,关注托管式语言模型行为评估中的可复现性问题。作者指出,当被评估的服务、测量工具或两者在多次运行之间发生变化时,评估结果可能随之改变,因此不能把一次评估得到的结论简单推广到同一模型标识的其他时段或配置。
论文把验证问题拆成三个层次。第一是复现:在历史配置下,用新数据重新检验先前发现是否再次出现。第二是测量敏感性:在相同公共标识下重建评估与推理配置后,端点是否发生变化。第三是持久性:在同一个测量工具下,该发现在随后测试的其他标识上是否仍然成立。
研究使用 Regent Chess 顺序环境。该环境会精确记录隐藏且可变的状态,使模型在动作时刻陈述的信念能够与真值对照评分;端点值为正表示表现差于匹配的均匀比较基线。
在复现测试中,先前报告的 Gemini 3.1 Flash-Lite 缺陷在其历史配置下、面对新对局时再次出现,效应为 +0.0530,95% 置信区间为 [+0.0329,+0.0714]。
在测量敏感性方面,作者在同一天、同一公共标识下进行背靠背的 H/R 比较。重建配置后,模型减均匀基线的端点降低了 0.0429,H 减 R 对比的 95% 置信区间为 [+0.0182,+0.0667]。由于六个配置组件同时变化,论文无法把影响归因于其中任何单一组件。
在重建 R 的条件下,一项前瞻性冻结、交错、同窗口的 4K 比较在 Gemini 3.1 与 Gemini 3.7 之间出现方向反转;这两个标识在发布时间和产品层级上均不同。其他描述性和探索性单元格也呈现相同方向模式。至于额外的服务期贡献,目前仍未得到确定结论,估计值为 -0.0166,区间为 [-0.0483,+0.0157]。
作者由此提出,在同一次评估中,复现、测量敏感性和持久性可能给出不同结论。因此,对托管模型的行为主张应显式标注其被测标识、服务期、测量工具和推理配置,以避免把不同条件下的结果混为一谈。