标签
Xiaomi在Hugging Face上发布了开源强化学习环境代码库,与购买类似资源相比,可节省AI任务获取的成本。
小米在 HuggingFace 上开源了用于训练其 MiMo 模型的约 7,000 个强化学习环境,涵盖代码、网络安全、通用、音乐和 Web 开发等领域。
Xiaomi MiMo 已开源强化学习训练环境和代码,适用于软件工程、漏洞复现和可视化开发等任务,提供详细指南和 Docker 支持。
SmolDataEnvs现已发布,这是一套包含5000个可验证RL环境任务的集合,专注于代码和数据科学领域的小型模型训练,完全开源。
来自 Salesforce 的这篇论文审计了用于终端智能体的公共强化学习环境,发现了重大缺陷,并介绍了 RIVER,一种训练方案,它过滤有缺陷的环境并惩罚重复行为以提升模型性能。
CodeMidas 是一个智能管道,它从源代码创建强化学习环境,扩展编程代理的训练,并在问题修复和程序构建等基准测试中展示性能提升。
Jerry Liu 分享了关于外派工程师(FDE)工作将如何转向定义目标、环境和评估,而自动化优化流程负责战术执行的想法。
The author argues that RL environments serve as the essential data for building AI agents, enabling systematic training, prompt optimization, and evaluation rather than manual iteration.
Standard Machines launches reinforcement-learning environments for chip design, aiming to accelerate tape-out and push frontier AI capabilities.
一个技术教程,介绍如何使用开源的Verifiers库为大型语言模型(LLMs)构建强化学习环境,并以奥赛罗(Othello)作为实际示例。
OpenReward环境现在可以直接通过单个OpenRewardSpec集成到TRL的GRPOTrainer中,从而能够针对一系列RL环境进行零代码粘合训练。该集成处于实验阶段,是让环境和智能体RL成为TRL一等公民的更广泛努力的一部分。
本文推荐了一个名为 Sophon 的网站,它聚合了 AI 领域的论文、模型、基准测试、排行榜和强化学习环境等信息,提供实时排行榜、对比和订阅功能,被誉为 AI 研究的 Bloomberg 终端。
Hugging Face Hub 已超过 4,000 个公开的强化学习环境,将自己定位为潜在的 RL 环境最大平台。
研究人员发布Terminal Wrench,一个涵盖331个可奖励黑客终端环境的数据集,包含3,632条横跨系统管理、机器学习与安全任务的利用轨迹。