标签
提出了NeSy-Spatial,一种神经符号框架,通过组合工具使用技能和几何技能来自我进化空间推理技能,提高了空间推理基准的准确性。
BigBang-v1 是来自上海 Endless Frontier Lab 的自我进化 36B 大语言模型,使用 AI 生成的前沿任务进行训练,仅用 10K 个高质量示例就在科学、编码、工具使用和长上下文方面取得了强劲表现。
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
一条推文,表达了对动态代理组织概念的惊叹——自我进化的多智能体系统,其图结构在执行过程中会自我重写。
本文综述了自演化编码智能体,这类智能体通过从先前的编码交互中更新框架、记忆、技能、工具或模型来改进其未来行为,并提出了一个分类体系,涵盖演化什么、何时演化以及由哪些软件特定证据驱动。
介绍了SciToolAgent-Evo,一种面向开放世界科学工具获取的本体感知自进化LLM智能体,以及包含900个真实任务的OpenSciToolBench基准。该智能体利用进化记忆和基于LinUCB的赌博机门控,动态探索并获取新工具。
AgentStream引入了一个统一框架,用于在流式任务场景下评估自进化LLM智能体,结果表明自进化的可靠性在不同场景下有所差异,并受模型能力制约。
SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。
本文介绍了一种用于主动具身安全的Self-Evolving Just-In-Time Memory框架,结合了Risk-Sufficient Topological Belief Graph、Agency-Grounded Factual Memory和Experience Memory,以在不阻碍任务进展的情况下减轻危险。在IS-Bench上的实验显示Safe-Success率显著提升(例如,在Qwen3-VL-8B上提升30.3%)。
微软的自进化智能体技能策略,像训练神经网络一样训练它们——使用epochs、batch size、学习率和验证门,完全开源。
微软开源了 SkillOpt,这是一个能让AI智能体技能自我改进的工具,通过自动评估和重写指令,无需绑定特定模型,即可超越手工制作的提示和其他优化器。
这篇论文提出SEED方法,通过自进化在线蒸馏将轨迹中的事后技能内化到模型参数中,解决长任务RL训练中奖励稀疏的问题,在ALFWorld等基准上取得了显著提升。
HealthClaw 是一个开源的代理架构,用于纵向个人健康管理,它使用自进化记忆来改进对重复交互的支持,在生物医学任务中实现了比基线更高的准确性和隐私性。
提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。
提出了EVOQUANT,一个自我进化的框架,利用LLM和验证器流水线自动化量化交易策略优化,在A股和加密货币市场上实现了夏普比率的显著提升。
介绍Critic Experience Bank (CEB),一个用于LLM智能体逐步置信度估计的自我演进批评框架,利用过去判断和后果的记忆库来改进校准,无需训练。
本文提出了一种方法,将重复的标准操作流程步骤编译为经过验证、有版本管理的工具,在部署前完成,替代推理时的代码生成。在一个配送中心的报警分类系统中,该方法将p50延迟降低了42%,端到端错误率降低了最多53%。
本文介绍了EvoSOP,一个使LLM代理能够将原子动作综合为可重用的标准操作程序(SOP)并迭代优化其工具集的框架,显著提高了任务成功率并减少了交互轮次。
HASE 是一个强化学习框架,它在统一的智能体过程中协同进化模型权重、任务解决方案以及流程组件(引导与评估),使单个8B参数的模型在文本分类和阿尔法因子挖掘任务上能够匹配更大系统的性能。
ComfyClaw是一种用于ComfyUI图像生成工作流的代理技能进化框架,利用类型化图编辑和区域级VLM验证器将视觉故障转化为修复建议,在多个配置中优于基线方法。