@rohanpaul_ai:Meta 新论文。代码优化看起来像是强化学习的简单扩展:奖励正确的程序,然后……
摘要
Meta 的一篇论文分析了标准 RL 方法为何在代码优化上失败,并通过校准后的计时、问题相对排名以及 GRPO 改动重建了整个反馈流水线,将 Qwen 2.5 7B 的速度阈值从 18.0% 提升至 31.3%。
查看缓存全文
缓存时间: 2026/08/03 03:34
新Meta论文。
代码优化看起来像是强化学习的简单扩展:奖励正确的程序,然后给更快的程序额外加分。
这篇论文说明了为什么这种通常的做法会失败。
指出代码优化需要协同设计测试、计时基础设施、奖励和GRPO。
运行时间是一个有噪声、稀疏的信号,测试、沙箱、奖励或GRPO更新中的小缺陷可能使模型几乎不加速,同时损害正确性。
作者重建了整个反馈路径:更大的优化测试、校准的远程执行服务、与人类解决方案进行问题相对排名、正确性门控的二元奖励,以及针对有噪声的零优势批次的GRPO修改。
他们通过为每个提示采样更多解决方案、扩大批次、取消组方差归一化以及丢弃过时的计时数据来稳定GRPO。
Qwen 2.5 7B 仅在重建整个计时流程后,才从前50%速度阈值的18.0%提升到31.3%。
– arxiv. org/abs/2607.25970
标题:“Reinforcement Learning for Code Optimization”
相似文章
@rohanpaul_ai: 精彩新论文来自Meta、CMU及其他实验室。表明编码代理通过制造自己的...来更快地提升。
来自Meta、CMU及其他实验室的一篇新论文提出了Self-play SWE-RL,这是一种方法,编码代理通过在实际代码库中制造和修复错误来训练自己,在SWE-bench基准测试上取得了显著提升,且不依赖人类编写的任务。
代码优化的强化学习
本文针对使用强化学习进行代码优化时面临的挑战,提出了三个阶段:通过DMC-Optim改进测试方法;通过正确性与速度组合以及离线模拟器将执行时间转化为奖励;以及调整GRPO以适应含噪时序奖励。该方法在代码优化基准测试中取得了显著提升。
@rohanpaul_ai: Meta 论文显示,当编程代理重复使用过去尝试的简短摘要而不是原始日志时,其性能会显著提升……
一篇 Meta 论文显示,编程代理在重复使用过去尝试的简短摘要而非原始日志时性能显著提升,使用 Claude 4.5 Opus 在 SWE-Bench 和 Terminal-Bench 上取得了显著改进。
@omarsar0: Qwen 发布了关于 RL 编码智能体的新工作。(请收藏)其理念是持续构建一个验证系统,该……
Qwen 的新论文研究了面向长周期编码智能体的奖励设计,指出由于奖励破解,每个验证信号最终都会失去对正确性的追踪能力,并论证了验证必须与策略能力共同进化。
@rohanpaul_ai: Meta、斯坦福、谷歌等多家顶级实验室的新论文提出了AutoResearchClaw。表明自动化研究改进…
来自Meta、斯坦福和谷歌的一篇新论文提出了AutoResearchClaw,该方法通过整合故障恢复、辩论和选择性人工输入来改进自动化研究。它在ARC-Bench上以54.7%的优势超越了AI Scientist v2,并揭示了当受到过程约束而非无限自由时,自主性会得到增强。