agentic-environments

标签

Cards List
#agentic-environments

@kubasienki: 哇,这样的发布常常孕育进步。

X AI KOLs Timeline · 5天前 缓存

Vincent Weisser 宣布发布超过365,000个开放的、基于代理的强化学习环境,适用于软件工程、终端和搜索代理。

0 人收藏 0 人点赞
#agentic-environments

@eliebakouch: 大量强化学习环境(36.5万个任务)集中在一个地方,一条指令

X AI KOLs Timeline · 5天前 缓存

Prime Intellect 发布超过36.5万个强化学习智能体任务,涵盖SWE、终端和搜索任务,通过单一API和指令即可访问。

0 人收藏 0 人点赞
#agentic-environments

@bojie_li: 介绍RLVP,Penalize the Path, Reward the Outcome:一篇我与华盛顿大学Noah Shi合作完成的论文…

X AI KOLs Timeline · 2026-07-09 缓存

本文介绍了RLVP(Reward the Outcome, Penalize the Path),一种强化学习方法,它使用可验证的路径违规惩罚和结果奖励,在实现高任务成功率的同时达到接近零的约束违规,提升了实际代理环境中的样本效率。

0 人收藏 0 人点赞
#agentic-environments

Qwen-AgentWorld: 通用智能体的语言世界模型

Hacker News Top · 2026-06-24 缓存

Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。

0 人收藏 0 人点赞
#agentic-environments

面向大型语言模型的智能体环境工程:环境建模、合成、评估与应用综述

Hugging Face Daily Papers · 2026-06-10 缓存

一篇关于面向大型语言模型的智能体环境工程的全面综述,涵盖环境建模、合成、评估与应用,重点聚焦于智能体与环境的协同演化。

0 人收藏 0 人点赞
#agentic-environments

@SergioPaniego: OpenEnv 有了新家:http://github.com/huggingface/OpenEnv… 从今天起,由一个委员会协调,其中包括…

X AI KOLs Following · 2026-06-08 缓存

OpenEnv,一个用于创建和部署隔离执行环境以进行智能体强化学习训练的框架,已迁移到 Hugging Face,现在由一个包括 Meta-PyTorch、NVIDIA 等的委员会管理。

1 人收藏 1 人点赞
← 返回首页

提交意见反馈