@adithya_s_k: 你真的可以用RL训练一个4B VLM来征服GeoGuesser > 开源代码、RL环境、数据集、训练设置、评估,以及…
摘要
公告宣布将发布开源资源,包括代码、RL环境和数据集,用于在4B VLM上应用RL以在GeoGuesser中表现出色,实现端到端复现。
你真的可以RL一个4B VLM来征服GeoGuesser 🌍
> 开源代码、RL环境、数据集、训练设置、评估,以及你需要的一切来端到端复现它
> 即将发布!! https://t.co/bfzNjRad8W
查看缓存全文
缓存时间: 2026/09/02 15:57
真的能通过强化学习训练一个40亿参数的视觉语言模型来玩转GeoGuesser🌍
开源代码、强化学习环境、数据集、训练设置、评估指标以及从头复现所需的全套资源 即将发布!! https://t.co/bfzNjRad8W
相似文章
@neural_avb: 用我的 SLM 在本地生成类似 GRPO 的 rollout,并用这个微型 RM 作为评分标准。接下来我将在…
Neural_avb 发布了一个轻量级的 Answer-eq 奖励模型,用于问答任务的强化学习训练,声称与外部评判 LM 的一致性达到 80%,且比 F1/ROUGE/BertScore 更快。
LEEPS:基于潜在引导的探索-利用提示采样,用于大型语言模型的高效RLVR
本文介绍了LEEPS,一种用于大型语言模型中基于可验证奖励的高效强化学习(RLVR)的潜在引导探索-利用提示采样器。它自适应地平衡了对信息丰富提示的重复利用和对不确定提示的探索,在基线上将推理基准分数提高了2.6-3.7%,而每个训练步骤仅增加约2秒的开销。
Geo-Strat-RL: 从可验证任务中学习地质事件推理
本文介绍了Geo-Strat-RL,一个使用可验证奖励强化学习(RLVR)来训练视觉语言模型从地层图和地震数据中推理地质事件历史的合成环境,展示了改进的重建和跨领域迁移能力。
@adithya_s_k: 现在,您只需几行代码即可使用 TRL 在 OpenReward 提供的 350+ 个强化学习环境上进行训练
OpenReward 和 TRL 现在支持在超过 350 个强化学习环境中进行训练,只需极少代码。
从 RLVR 到 RLSVR(GitHub 仓库)
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。