标签
This paper introduces SHAPER, a self-evolving framework for embodied agents that keeps model parameters frozen and improves performance by evolving reusable skills and context-code harnesses through target-environment rollouts. Evaluated on VLABench and ESI-Bench, it proposes a practical alternative to fine-tuning when training is expensive or unavailable.
本文介绍了 Spatial Memory Agent (SMA),一种运行时框架,通过验证器引导的反思和可复用记忆,在不进行参数更新或使用外部工具的情况下提升冻结视觉语言模型的空间推理能力,在五个基准和四个基础 VLM 上取得了强劲的结果。
本文提出了一种用于多轮共情对话的双循环自我进化框架,利用可验证的情感反馈来优化策略并调整训练分布。在SAGE上,它将Qwen3-8B的Overall得分从53.87提升至79.24,比均匀情感奖励强化学习高出7.23个百分点。
一篇综述论文,提出了智能体系统中协同进化的三阶段分类法,涵盖智能体-智能体、智能体-环境以及元协同进化,以实现超越固定人工设计路径的开放式改进。
本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。
SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。
Argus is a persistent, self-evolving agentic runtime designed for long-horizon reasoning, using Manager, Planner, Engineer, and Reviewer roles with verification-gated persistence and pivoting. It demonstrates strong results across seven benchmark arenas, including ~78% on SWE-Bench Pro, while reducing token usage after runtime self-evolution.
This paper proposes A/B Agent, a closed-loop agent framework that organizes historical A/B testing knowledge into a hierarchical experience tree, retrieves transferable strategies via multi-path Tree-RAG, and self-evolves through online experiment feedback, achieving a 4.829% GMV improvement in a short-video e-commerce recommendation system.
GDPevo是一个在真实业务任务上评估智能体自我进化的基准,涵盖CRM、ERP、金融、医疗、法律以及以数据为中心的工作流。作者发布了自动化流水线,并发现自我进化能将留出集准确率提升最多16.44个百分点,但智能体仍远低于全知的oracle上限。
Qwen 团队提出 Skill Self-Play 框架,通过 Proposer、Solver 和动态技能控制器协同自我对弈,在工具调用和推理任务上显著提升模型能力。
本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。
本文提出了一种新的任务——操作级表格问答(Operation-wise TableQA),具有细粒度的问题分类,并提出了SkillTGR,一种技能增强的表格图推理框架,该框架利用图遍历和分层技能库实现自进化推理,取得了优越的性能和效率。
本文提出MetaEvolve框架,利用强化学习训练LLMs掌握自我进化的元技能以实现迭代优化,在编码基准测试上取得了显著改进。
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
本文介绍了一种利用未来反馈预测实现开放式对话技能自我进化的方法,将对话反馈转化为固定的离线目标,从而无需实时流量即可进行可复现的技能优化。该方法在保护隐私的销售助手数据集上实现了超过75%的预测准确率。
Cura 1T 是一款专注于医疗领域的LLM,通过人工门控的自我进化循环进行训练,该循环在患者咨询、临床推理和智能体医疗任务上不断改进,在医学基准测试中取得了顶尖性能,同时保持了通用推理能力。
本文介绍了ABot-AgentOS,一种具有终身多模态记忆的通用机器人智能体操作系统,并提出了用于评估长周期具身任务的EmbodiedWorldBench。实验表明,该系统在任务成功率和记忆基准测试中取得了显著改进,表明专用的智能体操作系统层能够增强执行能力和持久记忆。
乔帮主开源了设计Skill qiaomu-design,提供风格试衣间、对抗AI味、自进化机制和成熟网站参考功能,支持GLM或Claude模型执行。
本文介绍了密封联合搜索(SJS)和Agora系统,其中五个专业化的LLM智能体类协作进化Alpha因子。在91天的CSI 1000留存集上,Agora实现了投资组合夏普比率+1.87,显著优于基线,并且发现的指标表现为系统的涌现属性。
介绍RSEA,一种利用三层自然语言状态和保留集选择门防止退化的LLM智能体递归自我进化方法。在四个基准测试中评估,结果表明上下文进化依赖于基准,且严格的选择门对可靠性至关重要。