跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

托管式LLM中的无持久性复现:动作时信念评估中的测量敏感性

文章摘要

该论文研究托管式语言模型行为评估的可变性,区分复现、测量敏感性与持久性三类问题。作者在 Regent Chess 环境中发现,先前的 Gemini 3.1 Flash-Lite 缺陷可在历史配置下复现,但在相同公共标识下重建评估与推理配置后端点显著变化;重建配置下 Gemini 3.1 与 3.7 的 4K 比较甚至反转方向。论文因此主张,对托管模型的行为结论应显式标注被测标识、服务期、测量工具与推理配置。

来源arXiv AI作者: Bhushan Kashinath Joshi
托管式LLM中的无持久性复现:动作时信念评估中的测量敏感性
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

这篇来自 arXiv 的论文(arXiv:2609.22478v1,cs.AI、cs.CL、cs.LG)由 Bhushan Kashinath Joshi 于 2026 年 9 月 18 日提交,关注托管式语言模型行为评估中的可复现性问题。作者指出,当被评估的服务、测量工具或两者在多次运行之间发生变化时,评估结果可能随之改变,因此不能把一次评估得到的结论简单推广到同一模型标识的其他时段或配置。

论文把验证问题拆成三个层次。第一是复现:在历史配置下,用新数据重新检验先前发现是否再次出现。第二是测量敏感性:在相同公共标识下重建评估与推理配置后,端点是否发生变化。第三是持久性:在同一个测量工具下,该发现在随后测试的其他标识上是否仍然成立。

研究使用 Regent Chess 顺序环境。该环境会精确记录隐藏且可变的状态,使模型在动作时刻陈述的信念能够与真值对照评分;端点值为正表示表现差于匹配的均匀比较基线。

在复现测试中,先前报告的 Gemini 3.1 Flash-Lite 缺陷在其历史配置下、面对新对局时再次出现,效应为 +0.0530,95% 置信区间为 [+0.0329,+0.0714]。

在测量敏感性方面,作者在同一天、同一公共标识下进行背靠背的 H/R 比较。重建配置后,模型减均匀基线的端点降低了 0.0429,H 减 R 对比的 95% 置信区间为 [+0.0182,+0.0667]。由于六个配置组件同时变化,论文无法把影响归因于其中任何单一组件。

在重建 R 的条件下,一项前瞻性冻结、交错、同窗口的 4K 比较在 Gemini 3.1 与 Gemini 3.7 之间出现方向反转;这两个标识在发布时间和产品层级上均不同。其他描述性和探索性单元格也呈现相同方向模式。至于额外的服务期贡献,目前仍未得到确定结论,估计值为 -0.0166,区间为 [-0.0483,+0.0157]。

作者由此提出,在同一次评估中,复现、测量敏感性和持久性可能给出不同结论。因此,对托管模型的行为主张应显式标注其被测标识、服务期、测量工具和推理配置,以避免把不同条件下的结果混为一谈。

展开要点与分析

文章情报

投资人进阶

要点

  • 将验证拆分为复现、测量敏感性与持久性三问。
  • Regent Chess 可精确记录隐藏可变状态,并在动作时刻用真值评分陈述信念。
  • 重建相同标识下的评估与推理配置后,模型减均匀基线端点降低 0.0429。
  • Gemini 3.1 与 3.7 的 4K 比较方向反转,额外服务期贡献仍待确定。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。