标签
本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。
SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。
Argus is a persistent, self-evolving agentic runtime designed for long-horizon reasoning, using Manager, Planner, Engineer, and Reviewer roles with verification-gated persistence and pivoting. It demonstrates strong results across seven benchmark arenas, including ~78% on SWE-Bench Pro, while reducing token usage after runtime self-evolution.
This paper proposes A/B Agent, a closed-loop agent framework that organizes historical A/B testing knowledge into a hierarchical experience tree, retrieves transferable strategies via multi-path Tree-RAG, and self-evolves through online experiment feedback, achieving a 4.829% GMV improvement in a short-video e-commerce recommendation system.
GDPevo是一个在真实业务任务上评估智能体自我进化的基准,涵盖CRM、ERP、金融、医疗、法律以及以数据为中心的工作流。作者发布了自动化流水线,并发现自我进化能将留出集准确率提升最多16.44个百分点,但智能体仍远低于全知的oracle上限。
Qwen 团队提出 Skill Self-Play 框架,通过 Proposer、Solver 和动态技能控制器协同自我对弈,在工具调用和推理任务上显著提升模型能力。
本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。
本文提出了一种新的任务——操作级表格问答(Operation-wise TableQA),具有细粒度的问题分类,并提出了SkillTGR,一种技能增强的表格图推理框架,该框架利用图遍历和分层技能库实现自进化推理,取得了优越的性能和效率。
本文提出MetaEvolve框架,利用强化学习训练LLMs掌握自我进化的元技能以实现迭代优化,在编码基准测试上取得了显著改进。
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
本文介绍了一种利用未来反馈预测实现开放式对话技能自我进化的方法,将对话反馈转化为固定的离线目标,从而无需实时流量即可进行可复现的技能优化。该方法在保护隐私的销售助手数据集上实现了超过75%的预测准确率。
Cura 1T 是一款专注于医疗领域的LLM,通过人工门控的自我进化循环进行训练,该循环在患者咨询、临床推理和智能体医疗任务上不断改进,在医学基准测试中取得了顶尖性能,同时保持了通用推理能力。
本文介绍了ABot-AgentOS,一种具有终身多模态记忆的通用机器人智能体操作系统,并提出了用于评估长周期具身任务的EmbodiedWorldBench。实验表明,该系统在任务成功率和记忆基准测试中取得了显著改进,表明专用的智能体操作系统层能够增强执行能力和持久记忆。
乔帮主开源了设计Skill qiaomu-design,提供风格试衣间、对抗AI味、自进化机制和成熟网站参考功能,支持GLM或Claude模型执行。
本文介绍了密封联合搜索(SJS)和Agora系统,其中五个专业化的LLM智能体类协作进化Alpha因子。在91天的CSI 1000留存集上,Agora实现了投资组合夏普比率+1.87,显著优于基线,并且发现的指标表现为系统的涌现属性。
介绍RSEA,一种利用三层自然语言状态和保留集选择门防止退化的LLM智能体递归自我进化方法。在四个基准测试中评估,结果表明上下文进化依赖于基准,且严格的选择门对可靠性至关重要。
本文提出EDV框架,在执行-提炼-验证阶段使用多个异构智能体为LLM智能体构建可靠经验,防止自我确认错误,并提升在长周期基准测试上的性能。
介绍了 Autogenesis 协议(AGP),这是一种自我演化型智能体协议,将组件的演化过程解耦,支持对基于 LLM 的多智能体系统中的提示词、智能体、工具、环境和记忆进行生命周期管理、版本追踪和安全回滚。
本文提出了VIBEMed,一种具有自进化机制和安全沙箱的多智能体框架,用于稳健的临床决策支持,集成了专门用于诊断、治疗计划以及随时间演化临床知识的智能体。
本文形式化了LLM智能体的通信策略,并提出了通信策略演化(CPE),一种通过 rollout 和提示级演化来优化通信策略的自我演化框架,在多种设置下实现了最佳任务成功率。