AI News HubLIVE
站内改写1 分钟阅读

RLPF:基于性能反馈的强化学习用于代码生成

代码模型越来越依赖执行反馈进行训练,但大多数信号只关注正确性。RLPF 将运行结果转化为分阶段奖励:失败程序按执行进展排序,正确程序按相对专家参考的改进程度排名。在 PerfCodeBench 上用 Qwen3-32B 微调后,正确且可运行方案从 11.1% 提升到 54.6%,相对效率从 8.1% 提升到 38.6%,并能与更强的开源权重系统竞争。

来源arXiv Machine Learning作者: Huihao Jing, Haozhe Cui, Wenbin Hu, Shaojin Chen, Haochen Shi, Changxuan Fan, Yuxuan Liu, Hanyu Yang, Sirui Zhang, Ziyi Chen, Haoran Li, Yangqiu Song

代码模型正越来越多地利用执行反馈进行训练,但大多数训练信号仍然停留在正确性层面。对于系统级代码而言,这留下了一个重要空白:两个程序可以通过相同的测试,但运行时差异可能非常大。近日,一篇由 Huihao Jing 等人提交至 arXiv 的论文提出 RLPF(Reinforcement Learning from Performance Feedback,基于性能反馈的强化学习),目的是让代码智能体不仅学会通过测试,还能主动优化所生成程序的执行效率。

论文指出,将运行时间直接作为奖励信号存在几个难点:运行时间只有在程序正确之后才有意义;不同任务之间运行时间的分布差异很大;当大多数采样程序无法编译或无法运行时,运行时间几乎无法提供有效指导。为此,RLPF 设计了一种分阶段奖励机制:对于编译或运行失败的程序,按照执行进展进行排序;对于能够正确运行的程序,则根据其相对于基线、向专家参考实现靠拢的程度进行排名。这样,模型在达到正确性之前也能获得有意义的反馈,而达到正确性之后又能获得对性能敏感的反馈。

研究人员使用 Qwen3-32B 作为基础模型,在 PerfCodeBench 上进行微调。结果显示,正确且可运行解决方案的比例从 11.1% 提升到 54.6%,相对效率从 8.1% 提升到 38.6%。经过训练后的模型能够与更强的开源权重系统竞争,并且其优化行为可以适度迁移到 EffiBench-X 基准上。进一步研究表明,由模型自身生成的参考实现虽然能提供一定监督,但效果弱于专家参考;而将正确性与运行时间结合起来的复合奖励,比单独使用正确性奖励或单独使用运行时间奖励更加可靠。

这项工作表明,代码智能体不仅可以通过强化学习学会编写能够通过测试的程序,还可以学会为其生成的程序进行性能优化。论文的 arXiv 编号为 2607.27271,提交于 2026 年 7 月 29 日,归类于机器学习(cs.LG)与软件工程(cs.SE)。