rl-environments

标签

Cards List
#rl-environments

@HarveenChadha: 本想找个安静的周末,但Xiaomi昨晚发布了他们的强化学习环境代码库。从某种角度来看,如果你必须……

X AI KOLs Timeline ↗ · 昨天 缓存

Xiaomi在Hugging Face上发布了开源强化学习环境代码库,与购买类似资源相比,可节省AI任务获取的成本。

0 人收藏 0 人点赞
#rl-environments

@BenjaminDEKR: 这大概是 Open AI 组织可能会考虑做的事情 ¯\_(ツ)_/¯

X AI KOLs Timeline ↗ · 昨天 缓存

小米在 HuggingFace 上开源了用于训练其 MiMo 模型的约 7,000 个强化学习环境,涵盖代码、网络安全、通用、音乐和 Web 开发等领域。

0 人收藏 0 人点赞
#rl-environments

@eliebakouch: Xiaomi MiMo 开源 RL 环境 + 训练代码 https://github.com/XiaomiMiMo/verl

X AI KOLs Timeline ↗ · 昨天 缓存

Xiaomi MiMo 已开源强化学习训练环境和代码,适用于软件工程、漏洞复现和可视化开发等任务,提供详细指南和 Docker 支持。

0 人收藏 0 人点赞
#rl-environments

@ClementDelangue: 非常高兴地发布SmolDataEnvs:5,000个用于代码和数据科学中优化小型模型的可验证RL环境任务…

X AI KOLs Timeline ↗ · 2天前 缓存

SmolDataEnvs现已发布,这是一套包含5000个可验证RL环境任务的集合,专注于代码和数据科学领域的小型模型训练,完全开源。

0 人收藏 0 人点赞
#rl-environments

@dair_ai: Salesforce 发表的一篇令人印象深刻的论文。它讨论了良好验证器对强化学习环境的重要性。只有 35.8% 的 …

X AI KOLs Timeline ↗ · 3天前 缓存

来自 Salesforce 的这篇论文审计了用于终端智能体的公共强化学习环境,发现了重大缺陷,并介绍了 RIVER,一种训练方案,它过滤有缺陷的环境并惩罚重复行为以提升模型性能。

0 人收藏 0 人点赞
#rl-environments

CodeMidas:从代码本身扩展智能编程强化学习环境

Hugging Face Daily Papers ↗ · 2026-09-18 缓存

CodeMidas 是一个智能管道,它从源代码创建强化学习环境,扩展编程代理的训练,并在问题修复和程序构建等基准测试中展示性能提升。

0 人收藏 0 人点赞
#rl-environments

@jerryjliu0:FDE工作的未来似乎与围绕评估/后训练/RL环境的所有工作密切相关。FDE实际上负责…

X AI KOLs Following ↗ · 2026-08-09 缓存

Jerry Liu 分享了关于外派工程师(FDE)工作将如何转向定义目标、环境和评估,而自动化优化流程负责战术执行的想法。

0 人收藏 0 人点赞
#rl-environments

RL Environments Are All You Need (6 minute read)

TLDR AI ↗ · 2026-08-06 缓存

The author argues that RL environments serve as the essential data for building AI agents, enabling systematic training, prompt optimization, and evaluation rather than manual iteration.

0 人收藏 0 人点赞
#rl-environments

@jacobpeake: Today, we're launching Standard Machines @stanmachines. We build reinforcement-learning environments for chip design. W…

X AI KOLs Following ↗ · 2026-08-05 缓存

Standard Machines launches reinforcement-learning environments for chip design, aiming to accelerate tape-out and push frontier AI capabilities.

0 人收藏 0 人点赞
#rl-environments

@akshay_pachaar: https://x.com/akshay_pachaar/status/2074200571834515574

X AI KOLs Following ↗ · 2026-07-06 缓存

一个技术教程,介绍如何使用开源的Verifiers库为大型语言模型(LLMs)构建强化学习环境,并以奥赛罗(Othello)作为实际示例。

0 人收藏 0 人点赞
#rl-environments

@SergioPaniego: https://x.com/SergioPaniego/status/2067270222671741360

X AI KOLs Timeline ↗ · 2026-06-17 缓存

OpenReward环境现在可以直接通过单个OpenRewardSpec集成到TRL的GRPOTrainer中,从而能够针对一系列RL环境进行零代码粘合训练。该集成处于实验阶段,是让环境和智能体RL成为TRL一等公民的更广泛努力的一部分。

0 人收藏 0 人点赞
#rl-environments

@vikingmute: 这是哪个神仙做的这个网站?https://sophon.at 收集和展示和AI 相关的所有信息和内容, 论文/最新模型/Benchmark/排行榜 论文还能直接在线看,非常非常全 还有 feed ,可以直接订阅了解最新的消息。 还有这个 …

X AI KOLs Timeline ↗ · 2026-06-05 缓存

本文推荐了一个名为 Sophon 的网站,它聚合了 AI 领域的论文、模型、基准测试、排行榜和强化学习环境等信息,提供实时排行榜、对比和订阅功能,被誉为 AI 研究的 Bloomberg 终端。

0 人收藏 0 人点赞
#rl-environments

@ClementDelangue: @huggingface hub 刚刚突破了 4,000 个公开的强化学习环境!这让我们成为最大的 RL 环境平台了吗,还是…

X AI KOLs Following ↗ · 2026-05-07 缓存

Hugging Face Hub 已超过 4,000 个公开的强化学习环境,将自己定位为潜在的 RL 环境最大平台。

0 人收藏 0 人点赞
#rl-environments

Terminal Wrench:包含331个可奖励黑客环境及3,632条利用轨迹的数据集

Hugging Face Daily Papers ↗ · 2026-04-19 缓存

研究人员发布Terminal Wrench,一个涵盖331个可奖励黑客终端环境的数据集,包含3,632条横跨系统管理、机器学习与安全任务的利用轨迹。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈