本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

オンポリシー蒸留におけるプロンプト幅とロールアウト更新の相互作用

記事の要約

新たなarXiv論文は、オンポリシー蒸留(OPD)におけるプロンプト幅と応答生成ポリシーの更新を同時に検討し、4.07ポイントの交互作用を報告した。応答を凍結した場合は幅の拡大で精度が下がるが、更新ごとに再生成すると精度が上がる。さらに2種類の教師下では、推論予算によって優劣が逆転する。

ソースarXiv Computational Linguistics著者: Lingxiang Hu, Tianle Xia, Ming Xu, Yiding Sun, Linfang Shang
オンポリシー蒸留におけるプロンプト幅とロールアウト更新の相互作用
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

2026年9月6日にarXivへ投稿された論文「Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation」は、Lingxiang Hu氏ら5名による研究成果で、arXiv:2609.25048として公開された。分野は計算と言語(cs.CL)および人工知能(cs.AI)で、21ページ、7図、11表からなる。論文はオンポリシー蒸留(OPD)における二つの制御要因、すなわちプロンプト幅(プロンプトバンクの大きさ)とロールアウト更新(訓練応答を生成する学生ポリシーのスナップショット数)を同時に扱う。問いは、OPDにどれだけのプロンプトが必要か、そしてその答えが応答生成に使う学生ポリシーにどう依存するかである。

実験は3x3の数学推論設定で行われ、14,080本の軌跡と110回の最適化更新を固定し、プロンプトバンクと応答生成ポリシーのスナップショット数だけを変化させた。10個のスナップショットを使う場合、8個のプロンプトで平均精度24.09%に達し、14,080個の異なるプロンプトを使った場合の24.51%に近づいた。これは応答が更新され続ける条件では、少数のプロンプトでも全量に近い性能が得られることを示す。

一方、応答を初期ポリシーに凍結すると、プロンプト幅を広げるほど平均精度は21.16%から19.05%へ低下した。逆に更新ごとに応答を再生成すると、幅の拡大は精度を23.61%から25.57%へ押し上げた。この交互作用は4.07ポイントで、95%の問題ペア区間は[2.00, 6.28]である。つまり、プロンプト数の効果は応答生成ポリシーを更新するかどうかに強く依存する。

さらに、2種類の教師モデルを用いた比較では第二の逆転が確認された。周期的に更新するモデルは短い推論予算で高い精度と回答完了率を示すが、32Kの出力上限では凍結応答モデルが平均精度で追い越し、その際に1.7〜1.8倍の応答トークンを消費した。著者らは、OPDにおけるプロンプト効率が更新の有無だけでなく推論予算にも依存すると結論づけている。この結果は、蒸留データの設計、プロンプトバンク構築、推論リソース配分に示唆を与えるが、現時点では特定の数学推論実験と教師・学生設定に限定される点には注意が必要である。

要点と分析を開く

記事インテリジェンス

研究者上級

要点

  • 14,080軌跡と110回の最適化更新を固定した3x3数学推論実験で、プロンプト幅の効果は応答を訓練中に更新するかどうかに依存した。
  • 初期ポリシーで応答を凍結すると、幅の拡大で平均精度が21.16%から19.05%に低下。更新ごとの再生成では23.61%から25.57%に上昇し、交互作用は4.07ポイント、95%問題ペア区間は[2.00, 6.28]。
  • 2種類の教師下の比較では、周期的更新モデルが短予算で高い精度と回答完了率を示したが、32K出力上限では凍結応答モデルが平均精度で逆転し、1.7〜1.8倍の応答トークンを使用した。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。