agentic-rl

标签

Cards List
#agentic-rl

AgentOPSD:智能体强化学习中的递归自蒸馏

Hugging Face Daily Papers · 4天前 缓存

AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。

0 人收藏 0 人点赞
#agentic-rl

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Hugging Face Daily Papers · 4天前 缓存

EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。

0 人收藏 0 人点赞
#agentic-rl

面向回合级智能体强化学习的科学发现环境扩展

arXiv cs.AI · 2026-08-03 缓存

本文介绍了SciDisco,一个可扩展的框架,用于通过过程可验证环境、基于DAG的轨迹合成和回合级强化学习来训练科学发现智能体。所提出的SciDisco-14B模型在假设驱动的科学数据分析基准上达到了最先进水平。

0 人收藏 0 人点赞
#agentic-rl

SkillRise:面向跨任务技能演化的智能体强化学习

Hugging Face Daily Papers · 2026-07-29 缓存

SkillRise 是一个统一的强化学习框架,使 LLM 智能体能够在相关且渐进难度的任务中学习并重用技能,在多个基准测试上比基线方法高出最多 8.5 个百分点。

0 人收藏 0 人点赞
#agentic-rl

Molt 智能体强化学习框架(GitHub 仓库)

TLDR AI · 2026-07-28 缓存

Molt 是来自 NVIDIA NeMo 的开源、原生 PyTorch 的智能体强化学习框架,旨在使用 Ray、vLLM 和 NVIDIA AutoModel 对大型多模态智能体模型进行可扩展的全异步训练。

0 人收藏 0 人点赞
#agentic-rl

@dair_ai:NVIDIA 最新研究。他们刚刚发布了一个面向智能体强化学习的 PyTorch 原生训练框架。(收藏)论文摘…

X AI KOLs Following · 2026-07-27 缓存

NVIDIA 发布了 Molt,一个面向智能体强化学习、注重紧凑性和可读性的 PyTorch 原生框架,性能与基于 Megatron 的堆栈相当。该框架是开源的,并附有论文。

0 人收藏 0 人点赞
#agentic-rl

Molt:一个可扩展的、基于PyTorch原生的智能体强化学习训练框架

Hugging Face Daily Papers · 2026-07-22 缓存

Molt是一个基于PyTorch原生的智能体强化学习训练框架,设计简洁紧凑,易于修改,同时实现了与基于Megatron的框架相当的性能。

0 人收藏 0 人点赞
#agentic-rl

@googledevs:Tunix 重大更新,助力规模化 Agentic RL 训练。新的异步解耦式回滚引擎解决了多轮交互瓶颈……

X AI KOLs Following · 2026-07-21 缓存

谷歌宣布其训练后优化库 Tunix 迎来重大更新,推出了异步解耦式回滚引擎,用于在 JAX/TPU 上规模化实施基于智能体的强化学习,消除空闲时间,提升吞吐量。

0 人收藏 0 人点赞
#agentic-rl

ToolVerse: 解锁大规模环境与长程任务,用于智能体强化学习

arXiv cs.AI · 2026-07-20 缓存

ToolVerse是一个框架,可从422个真实世界MCP环境(包含4438个工具)自动构建大规模可执行智能体训练环境,并提出了一种基于动态解锁采样算法的任务设计策略以生成长程任务,以及一种用于智能体强化学习中信用分配的轮次感知相对优势算法。

0 人收藏 0 人点赞
#agentic-rl

Muon何时有助于智能体强化学习?

Hugging Face Daily Papers · 2026-07-17 缓存

本文研究了Muon优化器在强化学习后训练中的应用,发现在ALFRED任务中,将Muon应用于隐藏权重矩阵相比AdamW显著提高了成功率,且结果依赖于优势估计器和学习率。

0 人收藏 0 人点赞
#agentic-rl

@VukRosic99: GLM 5.2 是如何训练的?清华异步强化学习论文解读——该论文用单次展开异步训练取代 GRPO 的等待全部展开批次的方法。

X AI KOLs Timeline · 2026-07-11 缓存

这篇来自清华大学的论文提出了单次展开异步优化 (SAO, Single-rollout Asynchronous Optimization),用于大语言模型的强化学习后训练。SAO 用单次展开异步训练取代了基于批次的 GRPO,以减少 GPU 空闲时间并提高稳定性。该技术被用于训练 GLM-5.2 模型(750B-A40B),在智能体编程和推理基准测试上取得了最先进的结果。

0 人收藏 0 人点赞
#agentic-rl

Z.ai的稳定异步强化学习(13分钟阅读)

TLDR AI · 2026-07-10 缓存

本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。

0 人收藏 0 人点赞
#agentic-rl

@Chengxing_Xie: 清华大学引入了SAO算法,旨在解决异步强化学习中的离策略漂移和稳定性挑战……

X AI KOLs Timeline · 2026-07-09 缓存

清华大学的SAO算法解决了大规模语言模型异步强化学习中的稳定性和离策略漂移问题,在智能体编程和推理基准测试上相比GRPO取得了稳定提升,并用于训练GLM-5.2模型。

0 人收藏 0 人点赞
#agentic-rl

面向智能体强化学习的单次生成异步优化

Hugging Face Daily Papers · 2026-07-08 缓存

本文提出了单次生成异步优化(SAO),以解决异步强化学习在智能体任务中的稳定性和离策略挑战,在编码和推理基准测试上优于GRPO及其变体。SAO已部署在GLM-5.2模型的智能体强化学习流程中。

0 人收藏 0 人点赞
#agentic-rl

@cwolferesearch: 智能体强化学习需要新的算法改进。在GRPO中,用于训练的“群体”开始发生变化……

X AI KOLs Timeline · 2026-07-07 缓存

本线程讨论了针对智能体强化学习对GRPO的改进,重点介绍了不同层级的优势归一化(提示层级、任务层级、环境层级),以应对多任务、多轮次环境中的高奖励方差。

0 人收藏 0 人点赞
#agentic-rl

@_akhaliq: LiteResearcher — 面向深度研究智能体的可扩展代理RL训练框架

X AI KOLs Following · 2026-07-01 缓存

LiteResearcher是一个可扩展的强化学习训练框架,专为深度研究智能体设计。

0 人收藏 0 人点赞
#agentic-rl

@qingke_ai: https://x.com/qingke_ai/status/2072159674078736556

X AI KOLs Timeline · 2026-07-01 缓存

本文详细介绍了 GLM-5.2 在 Agentic RL 中的最新进展,包括引入 slime 基础设施、从 GRPO 转向 PPO 处理长轨迹、以及在线反作弊机制;同时探讨了 Qwen 在验证器质量方面的研究,提出可扩展性、忠实性和鲁棒性三个维度,并针对不同任务设计了多种验证策略以提升奖励信号的可靠性。

0 人收藏 0 人点赞
#agentic-rl

TRIAGE:面向智能体强化学习的角色类型化信用分配

Hugging Face Daily Papers · 2026-06-30 缓存

介绍了TRIAGE,一种角色类型化信用分配框架,通过提供比标准GRPO方法更细致的信用分配来改进智能体强化学习。该框架使用结构化评判器对动作片段进行分类,并根据语义角色分配过程奖励。

0 人收藏 0 人点赞
#agentic-rl

@qingke_ai: https://x.com/qingke_ai/status/2071281892964659384

X AI KOLs Timeline · 2026-06-28 缓存

该文章由ROLL团队分享了在终端环境中进行Agentic RL训练时的实践经验,包括环境管理器设计、异步训练管线以及多种模式切换,并对比了RLVR与Agentic RL的本质区别。

0 人收藏 0 人点赞
#agentic-rl

@cwolferesearch: 智能体强化学习中最困难的方面之一是管理/扩展环境... [1/6]

X AI KOLs Timeline · 2026-06-26 缓存

一条讨论智能体强化学习中最困难的方面之一的推文串:管理和扩展环境。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈