首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

RLPF:根据性能反馈进行强化学习以生成代码

2026-08-01 1 阅读 约1分钟阅读 Huihao Jing, Haozhe Cui, Wenbin Hu, Shaojin Chen, Haochen Shi, Changxuan Fan, Yuxuan Liu, Hanyu Yang, Sirui Zhang, Ziyi Chen, Haoran Li, Yangqiu Song
分享:
字号:
arXiv:2607.27271v1 公告类型:新 摘要:代码模型越来越多地通过执行反馈进行训练,但大多数训练信号仍然停留在正确性上。这给系统代码留下了一个重要的空白:两个程序可以通过相同的测试,但运行时差异很大。我们研究如何训练代码代理以更快地正确实现,而不是仅将效率视为评估指标。关键的困难在于运行时间是一种脆弱的奖励。仅当程序正确、随任务变化并且在大多数示例程序无法编译或运行时提供很少的指导时,它才有意义。我们提出 \textbf{RLPF},即从绩效反馈中进行强化学习,它将执行结果转化为阶段性奖励。失败的程序按执行进度排序,而正确的程序按其从基线到专家参考的相对改进进行排名。这在正确性之前提供了有用的反馈,在正确性之后提供了对性能敏感的反馈。在 PerfCodeBench 上使用 RLPF 微调 Qwen3-32B 将正确且可运行的解决方案从 $11.1\%$ 提高到 $54.6\%$,并将相对效率从 $8.1\%$ 提高到 $38.6\%$。经过训练的模型与更强大的开放权重系统相比具有竞争力,并且其优化行为适度转移到 EffiBench-X。其他研究表明,模型生成的参考提供了有用但较弱的监督,并且完整的复合奖励比仅正确性或仅运行时的基线更可靠。这些结果表明,代码代理不仅可以通过训练来通过测试,还可以优化他们编写的程序。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱