arXiv 于 2026 年 9 月 6 日发布了一篇新论文《Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation》,作者为 Lingxiang Hu 等 5 人,论文编号 arXiv:2609.25048,属于计算与语言(cs.CL)和人工智能(cs.AI)分类,全文 21 页、7 幅图、11 张表。论文关注在线策略蒸馏(OPD)中的两个关键控制变量:提示广度,即训练提示库的大小;以及 rollout 刷新,即生成训练响应的学生策略快照数量。作者希望回答两个问题:OPD 究竟需要多少提示,以及这个答案是否取决于生成训练响应的学生策略。
为量化二者关系,作者设计了一个 3x3 数学推理实验。实验固定 14,080 条轨迹和 110 次优化器更新,只改变提示库和响应生成策略快照数量。结果显示,在使用十个策略快照时,仅用 8 个提示就能达到 24.09% 的平均准确率,接近使用 14,080 个不同提示时的 24.51%。这说明在响应不断刷新的条件下,少量提示可以达到接近全量提示的效果。
但进一步实验揭示出明显交互效应。如果响应冻结在初始策略不变,增加提示广度反而使准确率从 21.16% 下降到 19.05%;而在每次优化更新后刷新响应时,增加广度则使准确率从 23.61% 提高到 25.57%。两种条件下的交互效应为 4.07 个百分点,95% 问题配对区间为 [2.00, 6.28]。换言之,提示数量本身并不是决定因素,它是否有效取决于生成响应的策略是否随训练更新。
论文还在两种教师模型下进行了匹配比较,并观察到第二次反转。周期刷新模型在较短推理预算下具有更高的准确率和答案完成率;但在 32K 输出长度限制下,冻结响应模型在平均准确率上实现反超,同时使用 1.7 至 1.8 倍的响应 token。作者据此认为,OPD 中的提示效率可能同时受响应刷新和推理预算影响。该结论对蒸馏训练的数据构建、提示库设计和推理资源配置都具有参考意义,但其范围目前仍限于所研究的数学推理实验与特定教师/学生设置。