标签
RLPF 是一种强化学习方法,它在正确性之外还训练代码模型优化运行时间,使用基于执行进度和相对效率的分阶段奖励。在 PerfCodeBench 上使用 RLPF 微调 Qwen3-32B,将正确且可运行的解决方案从 11.1% 提高到 54.6%,并将相对效率从 8.1% 提高到 38.6%。
本文提出SalesLoop,一种强化学习框架,它通过使用性能感知奖励和判别性GRPO目标,在销售线索排序中建立了模型预测与实际业务结果之间的反馈闭环。该框架在离线实验中取得了显著改进,为期160天的生产A/B测试验证了+4.7%至+8.7%的累积提升。