本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

ホスト型LLMにおける持続性なき再現:行動時信念評価における測定感度

記事の要約

本論文は、ホスト型言語モデルの行動評価が実行ごとに変わりうる問題を、再現・測定感度・持続性という三つの検証に分けて分析する。Regent Chess 環境で、以前報告された Gemini 3.1 Flash-Lite の欠陥は歴史的構成の新規データで再現したが、同じ公開識別子で評価・推論構成を再構築すると端点が大きく変化し、Gemini 3.1 と 3.7 の 4K 比較では符号が反転した。著者らは、ホスト型モデルの行動主張をテスト識別子・提供期間・測定器・推論構成で明示的に索引付けする必要があると結論づける。

ソースarXiv AI著者: Bhushan Kashinath Joshi
ホスト型LLMにおける持続性なき再現:行動時信念評価における測定感度
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

arXiv に投稿された論文(arXiv:2609.22478v1、cs.AI、cs.CL、cs.LG)は、Bhushan Kashinath Joshi 氏による 2026 年 9 月 18 日提出の研究で、ホスト型言語モデルの行動評価における再現性の問題を扱っている。被評価サービス、測定器、あるいはその両方が実行ごとに異なれば、評価結果も変わりうるため、ある評価で得られた知見を同じモデル識別子の別の期間や構成へ単純に一般化することはできない。

論文は検証を三つに分ける。第一に再現(replication)で、過去の構成のまま新しいデータを用いて以前の知見が再び現れるかを問う。第二に測定感度(measurement sensitivity)で、同じ公開識別子のもとで評価・推論構成を再構築したとき端点が変わるかを調べる。第三に持続性(persistence)で、共通の測定器のもと、その後テストされた別の識別子でも知見が持続するかを見る。

実験環境は Regent Chess である。隠れた可変状態を正確に記録し、行動時点で表明された信念を真値と照合して採点できる。端点が正なら、対応する一様比較器より性能が悪いことを意味する。

再現テストでは、以前報告された Gemini 3.1 Flash-Lite の欠陥が、歴史的構成のまま新しい対局で再び確認された。効果量は +0.0530、95% 信頼区間は [+0.0329,+0.0714] である。

測定感度については、同一日・同一公開識別子で H/R を背中合わせに比較した。構成を再構築すると、モデルから一様比較器を引いた端点は 0.0429 低下し、H と R の対比の 95% 信頼区間は [+0.0182,+0.0667] だった。六つの構成要素が同時に変動するため、特定の要素だけを切り分けることはできない。

再構築された R のもとでは、事前に凍結された交互・同窓の 4K 比較において、Gemini 3.1 と Gemini 3.7 の間で符号が反転した。両識別子はリリース時期と製品階層が異なる。追加の記述的・探索的セルでも同じ方向のパターンが見られた。追加の提供期間の寄与は未解決のままで、推定値は -0.0166、区間は [-0.0483,+0.0157] である。

以上から著者らは、一つの評価の中でも再現・測定感度・持続性が異なる結論をもたらしうると述べる。したがってホスト型モデルの行動に関する主張は、テストした識別子、提供期間、測定器、推論構成によって明示的に索引付けされるべきだと主張している。

要点と分析を開く

記事インテリジェンス

投資家上級

要点

  • 検証を再現・測定感度・持続性の三つに分離する。
  • Regent Chess は隠れた可変状態を正確に記録し、行動時の信念を真値で採点する。
  • 同じ識別子で構成を再構築すると、モデル減一様比較器の端点が 0.0429 低下。
  • Gemini 3.1 と 3.7 の 4K 比較は符号反転、提供期間の寄与は未解決。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。