這篇來自 arXiv 的論文(arXiv:2609.22478v1,cs.AI、cs.CL、cs.LG)由 Bhushan Kashinath Joshi 於 2026 年 9 月 18 日提交,關注託管式語言模型行為評估中的可復現性問題。作者指出,當被評估的服務、測量工具或兩者在多次運行之間發生變化時,評估結果可能隨之改變,因此不能把一次評估得到的結論簡單推廣到同一模型標識的其他時段或配置。
論文把驗證問題拆成三個層次。第一是復現:在歷史配置下,用新數據重新檢驗先前發現是否再次出現。第二是測量敏感性:在相同公共標識下重建評估與推理配置後,端點是否發生變化。第三是持久性:在同一個測量工具下,該發現在隨後測試的其他標識上是否仍然成立。
研究使用 Regent Chess 順序環境。該環境會精確記錄隱藏且可變的狀態,使模型在動作時刻陳述的信念能夠與真值對照評分;端點值為正表示表現差於匹配的均勻比較基線。
在復現測試中,先前報告的 Gemini 3.1 Flash-Lite 缺陷在其歷史配置下、面對新對局時再次出現,效應為 +0.0530,95% 置信區間為 [+0.0329,+0.0714]。
在測量敏感性方面,作者在同一天、同一公共標識下進行背靠背的 H/R 比較。重建配置後,模型減均勻基線的端點降低了 0.0429,H 減 R 對比的 95% 置信區間為 [+0.0182,+0.0667]。由於六個配置組件同時變化,論文無法把影響歸因於其中任何單一組件。
在重建 R 的條件下,一項前瞻性凍結、交錯、同窗口的 4K 比較在 Gemini 3.1 與 Gemini 3.7 之間出現方向反轉;這兩個標識在發佈時間和產品層級上均不同。其他描述性和探索性單元格也呈現相同方向模式。至於額外的服務期貢獻,目前仍未得到確定結論,估計值為 -0.0166,區間為 [-0.0483,+0.0157]。
作者由此提出,在同一次評估中,復現、測量敏感性和持久性可能給出不同結論。因此,對託管模型的行為主張應顯式標註其被測標識、服務期、測量工具和推理配置,以避免把不同條件下的結果混為一談。