@neural_avb: 用我的 SLM 在本地生成类似 GRPO 的 rollout,并用这个微型 RM 作为评分标准。接下来我将在…
摘要
Neural_avb 发布了一个轻量级的 Answer-eq 奖励模型,用于问答任务的强化学习训练,声称与外部评判 LM 的一致性达到 80%,且比 F1/ROUGE/BertScore 更快。
查看缓存全文
缓存时间: 2026/06/12 04:54
使用我的SLM本地生成类似GRPO的rollout,并用这个微小的RM作为评分标准。接下来,我将在自由文本和问答上进行强化学习训练。
这:
- 超级快
- 比 F1/ROGUE/BertScore 好得多
- 与外部评审模型(DeepSeek)有80%的一致性
强化学习与不可验证的奖励!
耶!这一次我让GPT写了一些丰富的内容……通常我不会费心做这些漂亮的打印/流式处理,但因为最终会放到YouTube视频里……让东西看起来赏心悦目是我的支线任务之一。
让我想想!我得先自己把这套理念理清楚。
相似文章
@neural_avb: 正在研究推理训练文档。准备编写验证器环境,然后用 Unsloth/TRL 搞起来!如果一切顺利,很快就会出视频。
用户正在使用 Unsloth 和 TRL 实现带验证器的推理训练,报告了使用小型 SLM 和微型 RM 本地生成类似 GRPO 的样本的进展,并承诺很快发布视频。
不要偷看答案:面向无标签 RLVR 的结果掩码组相对策略优化
本文提出 OM-GRPO,一种无标签 RLVR 框架,通过对答案片段上的梯度进行掩码,将奖励估计与策略优化解耦,并引入对比增强奖励(Contrast-Augmented Reward),无需额外采样即可细化奖励估计。该框架在多种推理基准上持续优于现有无标签方法,并与有监督的 ground-truth 奖励训练表现相当。
@adithya_s_k: 你真的可以用RL训练一个4B VLM来征服GeoGuesser > 开源代码、RL环境、数据集、训练设置、评估,以及…
公告宣布将发布开源资源,包括代码、RL环境和数据集,用于在4B VLM上应用RL以在GeoGuesser中表现出色,实现端到端复现。
Z.ai的稳定异步强化学习(13分钟阅读)
本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。
@neural_avb: 今年早些时候发布的这篇后训练文章完全被我忽略了。强烈推荐给我的GRP…
推荐一篇关于GRPO/RLVR的后训练文章,该文章今年早些时候被忽视,适合对基于可验证奖励的强化学习感兴趣的人。