arXiv に投稿された論文(arXiv:2609.22478v1、cs.AI、cs.CL、cs.LG)は、Bhushan Kashinath Joshi 氏による 2026 年 9 月 18 日提出の研究で、ホスト型言語モデルの行動評価における再現性の問題を扱っている。被評価サービス、測定器、あるいはその両方が実行ごとに異なれば、評価結果も変わりうるため、ある評価で得られた知見を同じモデル識別子の別の期間や構成へ単純に一般化することはできない。
論文は検証を三つに分ける。第一に再現(replication)で、過去の構成のまま新しいデータを用いて以前の知見が再び現れるかを問う。第二に測定感度(measurement sensitivity)で、同じ公開識別子のもとで評価・推論構成を再構築したとき端点が変わるかを調べる。第三に持続性(persistence)で、共通の測定器のもと、その後テストされた別の識別子でも知見が持続するかを見る。
実験環境は Regent Chess である。隠れた可変状態を正確に記録し、行動時点で表明された信念を真値と照合して採点できる。端点が正なら、対応する一様比較器より性能が悪いことを意味する。
再現テストでは、以前報告された Gemini 3.1 Flash-Lite の欠陥が、歴史的構成のまま新しい対局で再び確認された。効果量は +0.0530、95% 信頼区間は [+0.0329,+0.0714] である。
測定感度については、同一日・同一公開識別子で H/R を背中合わせに比較した。構成を再構築すると、モデルから一様比較器を引いた端点は 0.0429 低下し、H と R の対比の 95% 信頼区間は [+0.0182,+0.0667] だった。六つの構成要素が同時に変動するため、特定の要素だけを切り分けることはできない。
再構築された R のもとでは、事前に凍結された交互・同窓の 4K 比較において、Gemini 3.1 と Gemini 3.7 の間で符号が反転した。両識別子はリリース時期と製品階層が異なる。追加の記述的・探索的セルでも同じ方向のパターンが見られた。追加の提供期間の寄与は未解決のままで、推定値は -0.0166、区間は [-0.0483,+0.0157] である。
以上から著者らは、一つの評価の中でも再現・測定感度・持続性が異なる結論をもたらしうると述べる。したがってホスト型モデルの行動に関する主張は、テストした識別子、提供期間、測定器、推論構成によって明示的に索引付けされるべきだと主張している。