@rohanpaul_ai:Meta 新论文。代码优化看起来像是强化学习的简单扩展:奖励正确的程序,然后……

X AI KOLs Following 论文

摘要

Meta 的一篇论文分析了标准 RL 方法为何在代码优化上失败,并通过校准后的计时、问题相对排名以及 GRPO 改动重建了整个反馈流水线,将 Qwen 2.5 7B 的速度阈值从 18.0% 提升至 31.3%。

Meta 新论文。 代码优化看起来像是强化学习的简单扩展:奖励正确的程序,然后给更快的程序额外加分。 这篇论文展示了为什么这种方法通常会失败。 指出代码优化需要协同设计测试、计时基础设施、奖励和 GRPO。 运行时是一个嘈杂且稀疏的信号,测试、沙箱、奖励或 GRPO 更新中的小缺陷可能会让模型几乎没有变快,同时还会损害正确性。 作者重建了整个反馈路径:更大的优化测试、校准过的远程执行服务、与人类解决方案相比的问题相对排名、正确性门控的二元奖励,以及针对嘈杂零优势批次的 GRPO 改动。 他们通过在每个提示上采样更多解决方案、扩大批次、去掉组方差归一化以及丢弃过时的计时数据来稳定 GRPO。 只有在重建了整个计时流水线之后,Qwen 2.5 7B 才在前 50% 速度阈值上从 18.0% 提升到 31.3%。 – arxiv.org/abs/2607.25970 标题:"Reinforcement Learning for Code Optimization"
查看原文
查看缓存全文

缓存时间: 2026/08/03 03:34

新Meta论文。

代码优化看起来像是强化学习的简单扩展:奖励正确的程序,然后给更快的程序额外加分。

这篇论文说明了为什么这种通常的做法会失败。

指出代码优化需要协同设计测试、计时基础设施、奖励和GRPO。

运行时间是一个有噪声、稀疏的信号,测试、沙箱、奖励或GRPO更新中的小缺陷可能使模型几乎不加速,同时损害正确性。

作者重建了整个反馈路径:更大的优化测试、校准的远程执行服务、与人类解决方案进行问题相对排名、正确性门控的二元奖励,以及针对有噪声的零优势批次的GRPO修改。

他们通过为每个提示采样更多解决方案、扩大批次、取消组方差归一化以及丢弃过时的计时数据来稳定GRPO。

Qwen 2.5 7B 仅在重建整个计时流程后,才从前50%速度阈值的18.0%提升到31.3%。

– arxiv. org/abs/2607.25970

标题:“Reinforcement Learning for Code Optimization”

相似文章

代码优化的强化学习

Hugging Face Daily Papers

本文针对使用强化学习进行代码优化时面临的挑战,提出了三个阶段:通过DMC-Optim改进测试方法;通过正确性与速度组合以及离线模拟器将执行时间转化为奖励;以及调整GRPO以适应含噪时序奖励。该方法在代码优化基准测试中取得了显著提升。