2026年9月6日にarXivへ投稿された論文「Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation」は、Lingxiang Hu氏ら5名による研究成果で、arXiv:2609.25048として公開された。分野は計算と言語(cs.CL)および人工知能(cs.AI)で、21ページ、7図、11表からなる。論文はオンポリシー蒸留(OPD)における二つの制御要因、すなわちプロンプト幅(プロンプトバンクの大きさ)とロールアウト更新(訓練応答を生成する学生ポリシーのスナップショット数)を同時に扱う。問いは、OPDにどれだけのプロンプトが必要か、そしてその答えが応答生成に使う学生ポリシーにどう依存するかである。
実験は3x3の数学推論設定で行われ、14,080本の軌跡と110回の最適化更新を固定し、プロンプトバンクと応答生成ポリシーのスナップショット数だけを変化させた。10個のスナップショットを使う場合、8個のプロンプトで平均精度24.09%に達し、14,080個の異なるプロンプトを使った場合の24.51%に近づいた。これは応答が更新され続ける条件では、少数のプロンプトでも全量に近い性能が得られることを示す。
一方、応答を初期ポリシーに凍結すると、プロンプト幅を広げるほど平均精度は21.16%から19.05%へ低下した。逆に更新ごとに応答を再生成すると、幅の拡大は精度を23.61%から25.57%へ押し上げた。この交互作用は4.07ポイントで、95%の問題ペア区間は[2.00, 6.28]である。つまり、プロンプト数の効果は応答生成ポリシーを更新するかどうかに強く依存する。
さらに、2種類の教師モデルを用いた比較では第二の逆転が確認された。周期的に更新するモデルは短い推論予算で高い精度と回答完了率を示すが、32Kの出力上限では凍結応答モデルが平均精度で追い越し、その際に1.7〜1.8倍の応答トークンを消費した。著者らは、OPDにおけるプロンプト効率が更新の有無だけでなく推論予算にも依存すると結論づけている。この結果は、蒸留データの設計、プロンプトバンク構築、推論リソース配分に示唆を与えるが、現時点では特定の数学推論実験と教師・学生設定に限定される点には注意が必要である。