标签
本文提出了反馈丰富环境(FEEs),通过丰富强化学习的反馈来引导长期任务中的自我进化智能体,并在使用Qwen3模型和RL算法的基准测试中显示了稳定性和性能的提升。
本文介绍HarnessEvo,将LLM代理框架分解为可独立演化的槽位,揭示优化价值局部存在于反思/控制等特定组件中,均匀预算分配次优,并主张针对性的预算集中。
本文综述将自我演化LLM智能体与动态图变换联系起来,提出一个框架将智能体状态建模为动态图,并组织现有方法以促进其演化。
SAGE是一个利用自演化规则和属性引导更新来自动化短剧制作中分镜生成的框架,实现了专家级性能,并在商业部署中减少了制作时间。
本文介绍了一篇来自DeepSeek的新论文,该论文提出了一种时空可组合性的编程范式,解决了自我进化智能体中的动态可组合性挑战。
PACE-Bench 引入了一个基于模拟器的基准,用于评估在物理适应任务中,经过环境突变后需要迭代重新设计代码的自进化智能体,并揭示了相比参数推断,机制重新设计是一个主要瓶颈。
SkillZip 是一种新方法,用于压缩自进化智能体积累的技能,无需评估展开;它通过找到一种最小且忠实的结构化解释,复用重复的规则和流程,同时保留罕见异常。
RoMeRL 提出了一种用于自进化 LLM 智能体的降阶记忆强化学习方法,该方法平衡了反馈覆盖度并避免了记忆-奖励陷阱。在 ALFWorld 和 LifelongAgentBench 上的实验表明,RoMeRL 提升了任务性能,将 Cold-Q 比率降低了 80%,提高了反馈密度,并减少了维护的记忆数量和 LLM 调用次数。
本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。
普林斯顿博士后Shilong Liu提出自进化代理的三层分类体系:工件迭代优化、Agent Harness自我改进和无黄金答案的模型学习,系统梳理了相关概念和前沿工作。
本文研究有偏见的LLM评委如何悄无声息地禁用自进化代理中的技能退出机制,表明跨越尖锐阈值的假阳性偏差阻止了基于贡献的退出,且该失败跨领域普遍存在,只能通过缺陷注入审计检测到。
Shilong Liu 提出了一种分类法,将自我进化智能体分为产物优化、框架自我改进和模型学习三类,为新兴智能体研究提供了通用语言。
一篇论文提出了一种机制,通过安全地将混乱的日常工作转化为学习数据来改进企业智能体,采用数据代理和控制层,AREAL2.0 展示了从真实交互轨迹进行在线强化学习。
本文介绍了SEA,一种用于自演化代理的架构,它将自我修改限制在转向适配器和围绕冻结基础模型的版本化框架上,并使用随时有效门(anytime-valid gates)来根据固定错误预算审计修改。在SWE-bench Verified上使用四个基础模型进行的实验表明,该套件在强基础模型上提供了+4%到+5%的提升,同时防止了性能回退。
Metis 开展了一项对比文本记忆与代码记忆的受控研究,发现两者具有互补的权衡特性。它提出了一种分层双表示记忆系统,在 AppWorld 基准测试中,任务准确率最高提升 20.6%,执行成本最高降低 22.8%。
SEAGym是一个新的评估环境,用于自进化LLM代理,它衡量代理框架在训练、验证、测试、重放和成本记录上的更新,提供关于进化过程的互补信号。
OPD-Evolver 提出了一种自我进化智能体框架,采用慢-快协同进化与在线策略自蒸馏,以增强记忆管理和策略学习,在多个领域基准测试中优于 ReasoningBank 和 Skill0 等现有方法。
对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。
PACE 为自进化代理引入了一种任意有效的提交门,它用序贯假设检验替代贪婪接受,控制错误提交概率,减少震荡,同时保持性能且方差更低。
本文介绍了FinEvolveBench(一个用于金融情感预测的基准测试)和Tree-of-Experience(ToE,一种针对低重复性任务和隐式奖励的LLM智能体的结构化经验管理方法)。实验表明,在此类挑战性场景中,ToE优于通用经验机制。