@Gorden_Sun: 通过coding agent实现启发式学习 用coding agent持续维护和迭代一套程序化策略系统,取代神经网络的梯度更新,在测试中,达到了Deep RL基线水平。可能成为“预训练→RLHF→大规模RL”之后的下一个范式。 过去就有启…
摘要
文章提出利用coding agent维护和迭代程序化策略系统以取代神经网络梯度更新,在Deep RL测试中达到基线水平,被视为继预训练和RLHF之后的潜在新范式。
查看缓存全文
缓存时间: 2026/05/10 06:22
通过coding agent实现启发式学习 用coding agent持续维护和迭代一套程序化策略系统,取代神经网络的梯度更新,在测试中,达到了Deep RL基线水平。可能成为“预训练→RLHF→大规模RL”之后的下一个范式。 过去就有启发式学习的概念,但是因为维护成本太高,现在有了coding agent,成本上可以跑通了。 https://t.co/1qG92jiNxi
相似文章
@Xudong07452910: RL 训练 LLM Agent 有个经典难题: 一次长任务失败后,模型到底该从哪里学起? 最终奖励通常只能告诉 Agent「成功或失败」,却很难指出中间哪些判断值得保留,哪些动作把整条轨迹带偏了。 这篇论文提出 SEED,用「自进化在线蒸…
这篇论文提出SEED方法,通过自进化在线蒸馏将轨迹中的事后技能内化到模型参数中,解决长任务RL训练中奖励稀疏的问题,在ALFWorld等基准上取得了显著提升。
@qingke_ai: https://x.com/qingke_ai/status/2071281892964659384
该文章由ROLL团队分享了在终端环境中进行Agentic RL训练时的实践经验,包括环境管理器设计、异步训练管线以及多种模式切换,并对比了RLVR与Agentic RL的本质区别。
@FeitengLi: 动手搭了一个 ReAct agent 系统:围绕 LLM 做 agent 系统 傍晚散步时在想:如何训练 LLM 的 agentic 能力、数据准备、模型训练、agent 轨迹 action 构造 RL 训练,再想 Claude 在过去一…
作者分享了搭建 ReAct agent 系统的经验,并介绍了智谱 AI 发布的 GLM-5 技术报告,该模型在 agentic、推理和编码方面取得了突破。
@charles_irl: 恰当的后训练强化学习,广泛部署,是迈向未来软件系统能悄然自我改进、适应人类需求的关键一步。
Modal 在其平台上宣布了一个开源的强化学习库,通过可扩展的部署解决后训练强化学习中的基础设施挑战。
@huxlab: 生产级 Agent 持续学习怎么做?Replit 给出了最扎实的答案。 Replit AI 负责人 Michele Catasta(@pirroh)分享了一篇非常干的文章,讲他们在过去一年如何为 Replit Agent 构建持续学习系统…
Replit AI 负责人分享生产级 Agent 持续学习系统的工程实践,将改进拆分为 Model、Harness、Context 三层,并构建离线验证与在线 A/B 测试的闭环,使 Agent 能在不更新模型的情况下持续优化。