arXiv 於 2026 年 9 月 6 日釋出了一篇新論文《Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation》,作者為 Lingxiang Hu 等 5 人,論文編號 arXiv:2609.25048,屬於計算與語言(cs.CL)和人工智慧(cs.AI)分類,全文 21 頁、7 幅圖、11 張表。論文關注線上策略蒸餾(OPD)中的兩個關鍵控制變數:提示廣度,即訓練提示庫的大小;以及 rollout 重新整理,即生成訓練響應的學生策略快照數量。作者希望回答兩個問題:OPD 究竟需要多少提示,以及這個答案是否取決於生成訓練響應的學生策略。
為量化二者關係,作者設計了一個 3x3 數學推理實驗。實驗固定 14,080 條軌跡和 110 次最佳化器更新,只改變提示庫和響應生成策略快照數量。結果顯示,在使用十個策略快照時,僅用 8 個提示就能達到 24.09% 的平均準確率,接近使用 14,080 個不同提示時的 24.51%。這說明在響應不斷重新整理的條件下,少量提示可以達到接近全量提示的效果。
但進一步實驗揭示出明顯互動效應。如果響應凍結在初始策略不變,增加提示廣度反而使準確率從 21.16% 下降到 19.05%;而在每次最佳化更新後重新整理響應時,增加廣度則使準確率從 23.61% 提高到 25.57%。兩種條件下的互動效應為 4.07 個百分點,95% 問題配對區間為 [2.00, 6.28]。換言之,提示數量本身並不是決定因素,它是否有效取決於生成響應的策略是否隨訓練更新。
論文還在兩種教師模型下進行了匹配比較,並觀察到第二次反轉。週期重新整理模型在較短推理預算下具有更高的準確率和答案完成率;但在 32K 輸出長度限制下,凍結響應模型在平均準確率上實現反超,同時使用 1.7 至 1.8 倍的響應 token。作者據此認為,OPD 中的提示效率可能同時受響應重新整理和推理預算影響。該結論對蒸餾訓練的資料構建、提示庫設計和推理資源配置都具有參考意義,但其範圍目前仍限於所研究的數學推理實驗與特定教師/學生設定。