@_akhaliq: LiteResearcher — 面向深度研究智能体的可扩展代理RL训练框架
摘要
LiteResearcher是一个可扩展的强化学习训练框架,专为深度研究智能体设计。
LiteResearcher
面向深度研究智能体的可扩展代理RL训练框架 https://t.co/pJUry7P2tT
查看缓存全文
缓存时间: 2026/07/01 18:12
LiteResearcher
一个可扩展的自主强化学习训练框架,用于深度研究代理 https://t.co/pJUry7P2tT
相似文章
Agent Lightning v1.0:迈向受控的代理强化学习
Agent Lightning v1.0 是一个轻量级框架,为代理环境启用可重现的强化学习,显著提升编码代理在如SWE-bench Verified等基准测试上的性能。
Agent Lightning: 使用强化学习训练任何AI智能体
Agent Lightning引入了一个灵活的强化学习框架,用于训练AI智能体中的大型语言模型,实现了智能体执行与训练的解耦,以处理复杂交互。
@tom_doerr: 使用强化学习构建自定义AI代理 https://github.com/agentica-project/rllm…
rLLM 是一个开源框架,通过强化学习对语言代理进行后训练,其发布的重要模型如 DeepSWE-Preview 和 DeepCoder-14B-Preview 取得了最先进的结果。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。
@dair_ai:NVIDIA 最新研究。他们刚刚发布了一个面向智能体强化学习的 PyTorch 原生训练框架。(收藏)论文摘…
NVIDIA 发布了 Molt,一个面向智能体强化学习、注重紧凑性和可读性的 PyTorch 原生框架,性能与基于 Megatron 的堆栈相当。该框架是开源的,并附有论文。