@rohanpaul_ai: 关于自我进化智能体的优秀论文。企业智能体无法真正改进,直到其混乱的日常工作成为安全的学…

X AI KOLs Timeline 论文

摘要

一篇论文提出了一种机制,通过安全地将混乱的日常工作转化为学习数据来改进企业智能体,采用数据代理和控制层,AREAL2.0 展示了从真实交互轨迹进行在线强化学习。

关于自我进化智能体的优秀论文。 企业智能体无法真正改进,直到其混乱的日常工作成为安全的学习数据。 未来的企业智能体可以通过在改变其底层模型之前更新记忆来进行改进。 问题在于,部署的智能体会生成许多有用的轨迹,但团队通常通过缓慢的手动检查、提示编辑、重新训练和重新部署来改进它们。 他们提出了一种三部分机制:首先,以共享的、可用于学习的格式记录每个智能体步骤;其次,使用数据代理来清理、治理、存储和重放实际的智能体工作;第三,使用控制层来决定是否更新记忆、技能、提示、工具或模型权重。 AREAL2.0 展示了这一思想的一个窄版本,其中实时智能体的 LLM 调用通过在线强化学习服务进行路由,以便真实的交互轨迹可以用于训练未来的模型更新。 作者表示,主要差距在于一个能将智能体活动转化为可用学习数据的系统,而不是另一个聪明的优化器。 未来的智能体将需要安全、可重放的方式来更新记忆、技能、提示、工具或模型,而不会失控。 ---- Link – arxiv. org/abs/2607.01120v1 Title: "Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents"
查看原文
查看缓存全文

缓存时间: 2026/07/03 06:30

一篇关于自我进化智能体的优秀论文。

企业级智能体只有在其混乱的日常工作成为安全的学习数据后,才能真正实现改进。

未来的企业级智能体可能会通过先更新记忆再修改底层模型的方式来提升性能。

问题在于:已部署的智能体会产生大量有用痕迹,但团队通常依赖缓慢的手动检查、提示编辑、重新训练和重新部署来改进它们。

他们提出了一种三部分机制:首先,以统一的可学习格式记录每个智能体的每一步操作;其次,使用数据代理来清理、管理、存储和回放真实的智能体工作;最后,使用控制层来决定是否更新记忆、技能、提示、工具或模型权重。

AREAL2.0 展示了这一思路的一个简化版本:让实时的智能体 LLM 调用通过一个在线强化学习服务进行路由,从而使真实的交互痕迹可用于训练未来的模型更新。

作者指出,主要缺口是一个能将智能体活动转化为可用学习数据的系统,而不是另一个精巧的优化器。

未来的智能体需要一种安全、可回放的方式来更新记忆、技能、提示、工具或模型,而不会失控。


链接 – arxiv.org/abs/2607.01120v1

标题:“下一代智能体强化学习系统使智能体能够自我进化”

相似文章