@adithya_s_k: 你真的可以用RL训练一个4B VLM来征服GeoGuesser > 开源代码、RL环境、数据集、训练设置、评估,以及…

X AI KOLs Timeline 工具

摘要

公告宣布将发布开源资源,包括代码、RL环境和数据集,用于在4B VLM上应用RL以在GeoGuesser中表现出色,实现端到端复现。

你真的可以RL一个4B VLM来征服GeoGuesser 🌍 > 开源代码、RL环境、数据集、训练设置、评估,以及你需要的一切来端到端复现它 > 即将发布!! https://t.co/bfzNjRad8W
查看原文
查看缓存全文

缓存时间: 2026/09/02 15:57

真的能通过强化学习训练一个40亿参数的视觉语言模型来玩转GeoGuesser🌍

开源代码、强化学习环境、数据集、训练设置、评估指标以及从头复现所需的全套资源 即将发布!! https://t.co/bfzNjRad8W

相似文章

Geo-Strat-RL: 从可验证任务中学习地质事件推理

arXiv cs.LG

本文介绍了Geo-Strat-RL,一个使用可验证奖励强化学习(RLVR)来训练视觉语言模型从地层图和地震数据中推理地质事件历史的合成环境,展示了改进的重建和跨领域迁移能力。

从 RLVR 到 RLSVR(GitHub 仓库)

TLDR AI

介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。