跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

線上策略蒸餾中提示廣度與 rollout 重新整理相互影響

文章摘要

一篇新 arXiv 論文聯合研究線上策略蒸餾(OPD)中的提示廣度和響應生成策略重新整理,發現兩者存在 4.07 個百分點的互動效應:在響應凍結時增加提示會降低準確率,而在每次更新重新整理時則會提高準確率;兩種教師模型下的比較還顯示結論會隨推理預算反轉。

來源arXiv Computational Linguistics作者: Lingxiang Hu, Tianle Xia, Ming Xu, Yiding Sun, Linfang Shang
線上策略蒸餾中提示廣度與 rollout 重新整理相互影響
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

arXiv 於 2026 年 9 月 6 日釋出了一篇新論文《Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation》,作者為 Lingxiang Hu 等 5 人,論文編號 arXiv:2609.25048,屬於計算與語言(cs.CL)和人工智慧(cs.AI)分類,全文 21 頁、7 幅圖、11 張表。論文關注線上策略蒸餾(OPD)中的兩個關鍵控制變數:提示廣度,即訓練提示庫的大小;以及 rollout 重新整理,即生成訓練響應的學生策略快照數量。作者希望回答兩個問題:OPD 究竟需要多少提示,以及這個答案是否取決於生成訓練響應的學生策略。

為量化二者關係,作者設計了一個 3x3 數學推理實驗。實驗固定 14,080 條軌跡和 110 次最佳化器更新,只改變提示庫和響應生成策略快照數量。結果顯示,在使用十個策略快照時,僅用 8 個提示就能達到 24.09% 的平均準確率,接近使用 14,080 個不同提示時的 24.51%。這說明在響應不斷重新整理的條件下,少量提示可以達到接近全量提示的效果。

但進一步實驗揭示出明顯互動效應。如果響應凍結在初始策略不變,增加提示廣度反而使準確率從 21.16% 下降到 19.05%;而在每次最佳化更新後重新整理響應時,增加廣度則使準確率從 23.61% 提高到 25.57%。兩種條件下的互動效應為 4.07 個百分點,95% 問題配對區間為 [2.00, 6.28]。換言之,提示數量本身並不是決定因素,它是否有效取決於生成響應的策略是否隨訓練更新。

論文還在兩種教師模型下進行了匹配比較,並觀察到第二次反轉。週期重新整理模型在較短推理預算下具有更高的準確率和答案完成率;但在 32K 輸出長度限制下,凍結響應模型在平均準確率上實現反超,同時使用 1.7 至 1.8 倍的響應 token。作者據此認為,OPD 中的提示效率可能同時受響應重新整理和推理預算影響。該結論對蒸餾訓練的資料構建、提示庫設計和推理資源配置都具有參考意義,但其範圍目前仍限於所研究的數學推理實驗與特定教師/學生設定。

展開要點與分析

文章情報

研究者進階

要點

  • 在固定 14,080 條軌跡和 110 次最佳化器更新的 3x3 數學推理實驗中,提示廣度是否有益取決於響應是否在訓練中重新整理。
  • 響應凍結於初始策略時,提示從少到多使準確率從 21.16% 降至 19.05%;按每次更新重新整理時,準確率從 23.61% 升至 25.57%,互動效應為 4.07 個百分點,95% 問題配對區間為 [2.00, 6.28]。
  • 在兩種教師模型下的匹配比較中,週期重新整理模型在短預算下準確率和答案完成率更高,但凍結響應模型在 32K 輸出上限時平均準確率反超,並消耗 1.7–1.8 倍的響應 token。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。