@rohanpaul_ai: 关于自我进化智能体的优秀论文。企业智能体无法真正改进,直到其混乱的日常工作成为安全的学…
摘要
一篇论文提出了一种机制,通过安全地将混乱的日常工作转化为学习数据来改进企业智能体,采用数据代理和控制层,AREAL2.0 展示了从真实交互轨迹进行在线强化学习。
查看缓存全文
缓存时间: 2026/07/03 06:30
一篇关于自我进化智能体的优秀论文。
企业级智能体只有在其混乱的日常工作成为安全的学习数据后,才能真正实现改进。
未来的企业级智能体可能会通过先更新记忆再修改底层模型的方式来提升性能。
问题在于:已部署的智能体会产生大量有用痕迹,但团队通常依赖缓慢的手动检查、提示编辑、重新训练和重新部署来改进它们。
他们提出了一种三部分机制:首先,以统一的可学习格式记录每个智能体的每一步操作;其次,使用数据代理来清理、管理、存储和回放真实的智能体工作;最后,使用控制层来决定是否更新记忆、技能、提示、工具或模型权重。
AREAL2.0 展示了这一思路的一个简化版本:让实时的智能体 LLM 调用通过一个在线强化学习服务进行路由,从而使真实的交互痕迹可用于训练未来的模型更新。
作者指出,主要缺口是一个能将智能体活动转化为可用学习数据的系统,而不是另一个精巧的优化器。
未来的智能体需要一种安全、可回放的方式来更新记忆、技能、提示、工具或模型,而不会失控。
链接 – arxiv.org/abs/2607.01120v1
标题:“下一代智能体强化学习系统使智能体能够自我进化”
相似文章
@dair_ai: 关于自我改进智能体的优秀论文:
本周一篇重要的AI论文探讨了自我改进智能体是否真正发现新知识,还是仅仅在重新混合现有信息。
@omarsar0:关于自我改进智能体的优秀论文。为什么?我们需要更深入地思考 AI 智能体系统设计。该协议规范……
一篇论文提出了一种自我改进 AI 智能体的协议框架,支持可审计的改进提案、评估与回滚。
@rohanpaul_ai: 精彩新论文来自Meta、CMU及其他实验室。表明编码代理通过制造自己的...来更快地提升。
来自Meta、CMU及其他实验室的一篇新论文提出了Self-play SWE-RL,这是一种方法,编码代理通过在实际代码库中制造和修复错误来训练自己,在SWE-bench基准测试上取得了显著提升,且不依赖人类编写的任务。
@rohanpaul_ai: 更好的自我改进智能体需要更好的求解器,而非更大的更新编写模型。这挑战了常见的习惯……
本文厘清了自我改进的LLM智能体中进化器与智能体的角色,表明一个小型进化器可以编写足够好的更新,而中端智能体最能从中受益。论文建议将最强的模型用作任务执行器,而非更新编写器。
@HuggingPapers: 现代智能体系统中的自我改进——一项涵盖239篇论文的调研,关于AI智能体如何通过更新模型…
一项涵盖239篇论文的调研,分析AI智能体如何通过更新模型本身或框架(提示、记忆、工具)来自我提升。