@Gorden_Sun: 通过coding agent实现启发式学习 用coding agent持续维护和迭代一套程序化策略系统,取代神经网络的梯度更新,在测试中,达到了Deep RL基线水平。可能成为“预训练→RLHF→大规模RL”之后的下一个范式。 过去就有启…

X AI KOLs Timeline 论文

摘要

文章提出利用coding agent维护和迭代程序化策略系统以取代神经网络梯度更新,在Deep RL测试中达到基线水平,被视为继预训练和RLHF之后的潜在新范式。

通过coding agent实现启发式学习 用coding agent持续维护和迭代一套程序化策略系统,取代神经网络的梯度更新,在测试中,达到了Deep RL基线水平。可能成为“预训练→RLHF→大规模RL”之后的下一个范式。 过去就有启发式学习的概念,但是因为维护成本太高,现在有了coding agent,成本上可以跑通了。 https://t.co/1qG92jiNxi
查看原文
查看缓存全文

缓存时间: 2026/05/10 06:22

通过coding agent实现启发式学习 用coding agent持续维护和迭代一套程序化策略系统,取代神经网络的梯度更新,在测试中,达到了Deep RL基线水平。可能成为“预训练→RLHF→大规模RL”之后的下一个范式。 过去就有启发式学习的概念,但是因为维护成本太高,现在有了coding agent,成本上可以跑通了。 https://t.co/1qG92jiNxi

相似文章

@Xudong07452910: RL 训练 LLM Agent 有个经典难题: 一次长任务失败后,模型到底该从哪里学起? 最终奖励通常只能告诉 Agent「成功或失败」,却很难指出中间哪些判断值得保留,哪些动作把整条轨迹带偏了。 这篇论文提出 SEED,用「自进化在线蒸…

X AI KOLs Timeline

这篇论文提出SEED方法,通过自进化在线蒸馏将轨迹中的事后技能内化到模型参数中,解决长任务RL训练中奖励稀疏的问题,在ALFWorld等基准上取得了显著提升。

@huxlab: 生产级 Agent 持续学习怎么做?Replit 给出了最扎实的答案。 Replit AI 负责人 Michele Catasta(@pirroh)分享了一篇非常干的文章,讲他们在过去一年如何为 Replit Agent 构建持续学习系统…

X AI KOLs Timeline

Replit AI 负责人分享生产级 Agent 持续学习系统的工程实践,将改进拆分为 Model、Harness、Context 三层,并构建离线验证与在线 A/B 测试的闭环,使 Agent 能在不更新模型的情况下持续优化。