跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

在线策略蒸馏中提示广度与 rollout 刷新相互影响

文章摘要

一篇新 arXiv 论文联合研究在线策略蒸馏(OPD)中的提示广度和响应生成策略刷新,发现两者存在 4.07 个百分点的交互效应:在响应冻结时增加提示会降低准确率,而在每次更新刷新时则会提高准确率;两种教师模型下的比较还显示结论会随推理预算反转。

来源arXiv Computational Linguistics作者: Lingxiang Hu, Tianle Xia, Ming Xu, Yiding Sun, Linfang Shang
在线策略蒸馏中提示广度与 rollout 刷新相互影响
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

arXiv 于 2026 年 9 月 6 日发布了一篇新论文《Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation》,作者为 Lingxiang Hu 等 5 人,论文编号 arXiv:2609.25048,属于计算与语言(cs.CL)和人工智能(cs.AI)分类,全文 21 页、7 幅图、11 张表。论文关注在线策略蒸馏(OPD)中的两个关键控制变量:提示广度,即训练提示库的大小;以及 rollout 刷新,即生成训练响应的学生策略快照数量。作者希望回答两个问题:OPD 究竟需要多少提示,以及这个答案是否取决于生成训练响应的学生策略。

为量化二者关系,作者设计了一个 3x3 数学推理实验。实验固定 14,080 条轨迹和 110 次优化器更新,只改变提示库和响应生成策略快照数量。结果显示,在使用十个策略快照时,仅用 8 个提示就能达到 24.09% 的平均准确率,接近使用 14,080 个不同提示时的 24.51%。这说明在响应不断刷新的条件下,少量提示可以达到接近全量提示的效果。

但进一步实验揭示出明显交互效应。如果响应冻结在初始策略不变,增加提示广度反而使准确率从 21.16% 下降到 19.05%;而在每次优化更新后刷新响应时,增加广度则使准确率从 23.61% 提高到 25.57%。两种条件下的交互效应为 4.07 个百分点,95% 问题配对区间为 [2.00, 6.28]。换言之,提示数量本身并不是决定因素,它是否有效取决于生成响应的策略是否随训练更新。

论文还在两种教师模型下进行了匹配比较,并观察到第二次反转。周期刷新模型在较短推理预算下具有更高的准确率和答案完成率;但在 32K 输出长度限制下,冻结响应模型在平均准确率上实现反超,同时使用 1.7 至 1.8 倍的响应 token。作者据此认为,OPD 中的提示效率可能同时受响应刷新和推理预算影响。该结论对蒸馏训练的数据构建、提示库设计和推理资源配置都具有参考意义,但其范围目前仍限于所研究的数学推理实验与特定教师/学生设置。

展开要点与分析

文章情报

研究者进阶

要点

  • 在固定 14,080 条轨迹和 110 次优化器更新的 3x3 数学推理实验中,提示广度是否有益取决于响应是否在训练中刷新。
  • 响应冻结于初始策略时,提示从少到多使准确率从 21.16% 降至 19.05%;按每次更新刷新时,准确率从 23.61% 升至 25.57%,交互效应为 4.07 个百分点,95% 问题配对区间为 [2.00, 6.28]。
  • 在两种教师模型下的匹配比较中,周期刷新模型在短预算下准确率和答案完成率更高,但冻结响应模型在 32K 输出上限时平均准确率反超,并消耗 1.7–1.8 倍的响应 token。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。