performance-feedback

标签

Cards List
#performance-feedback

RLPF:面向代码生成的基于性能反馈的强化学习

arXiv cs.LG ↗ · 2026-07-31 缓存

RLPF 是一种强化学习方法,它在正确性之外还训练代码模型优化运行时间,使用基于执行进度和相对效率的分阶段奖励。在 PerfCodeBench 上使用 RLPF 微调 Qwen3-32B,将正确且可运行的解决方案从 11.1% 提高到 54.6%,并将相对效率从 8.1% 提高到 38.6%。

0 人收藏 0 人点赞
#performance-feedback

SalesLoop:基于绩效反馈的销售线索排序强化学习

arXiv cs.LG ↗ · 2026-07-24 缓存

本文提出SalesLoop,一种强化学习框架,它通过使用性能感知奖励和判别性GRPO目标,在销售线索排序中建立了模型预测与实际业务结果之间的反馈闭环。该框架在离线实验中取得了显著改进,为期160天的生产A/B测试验证了+4.7%至+8.7%的累积提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈