标签
作者评论 Deepseek Harness 的插件化理念,认为其将 GUI/TUI 等全部插件化、反对固化工作流,并对比 Pi Agent、Prime-Agent,提出在 REPL 中构建可自进化的 Agent 构想,已用 Codex 开始实现。
MEGA是一种自进化的基础设施,用于编码智能体优化,它从会话中提炼可复用的智慧,通过类型化智慧图对其进行组合,并利用运行证据持续改进智能体以及指导其优化的知识。
GeoForge 是一个无需训练、自进化的地球观测推理框架,它将已完成的轨迹组织成非参数记忆,以改进 LLM 智能体的规划和工具使用,而无需更新骨干模型。
LinkedIn presents a self-evolving agentic customer support system that integrates RAG with evolutionary auto-prompting and modular evaluation, achieving significant gains in production A/B tests including a 9.0-point increase in QA self-serve and 30.6-point improvement in routing accuracy.
提出了NeSy-Spatial,一种神经符号框架,通过组合工具使用技能和几何技能来自我进化空间推理技能,提高了空间推理基准的准确性。
BigBang-v1 是来自上海 Endless Frontier Lab 的自我进化 36B 大语言模型,使用 AI 生成的前沿任务进行训练,仅用 10K 个高质量示例就在科学、编码、工具使用和长上下文方面取得了强劲表现。
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
一条推文,表达了对动态代理组织概念的惊叹——自我进化的多智能体系统,其图结构在执行过程中会自我重写。
本文综述了自演化编码智能体,这类智能体通过从先前的编码交互中更新框架、记忆、技能、工具或模型来改进其未来行为,并提出了一个分类体系,涵盖演化什么、何时演化以及由哪些软件特定证据驱动。
介绍了SciToolAgent-Evo,一种面向开放世界科学工具获取的本体感知自进化LLM智能体,以及包含900个真实任务的OpenSciToolBench基准。该智能体利用进化记忆和基于LinUCB的赌博机门控,动态探索并获取新工具。
AgentStream引入了一个统一框架,用于在流式任务场景下评估自进化LLM智能体,结果表明自进化的可靠性在不同场景下有所差异,并受模型能力制约。
SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。
本文介绍了一种用于主动具身安全的Self-Evolving Just-In-Time Memory框架,结合了Risk-Sufficient Topological Belief Graph、Agency-Grounded Factual Memory和Experience Memory,以在不阻碍任务进展的情况下减轻危险。在IS-Bench上的实验显示Safe-Success率显著提升(例如,在Qwen3-VL-8B上提升30.3%)。
微软的自进化智能体技能策略,像训练神经网络一样训练它们——使用epochs、batch size、学习率和验证门,完全开源。
微软开源了 SkillOpt,这是一个能让AI智能体技能自我改进的工具,通过自动评估和重写指令,无需绑定特定模型,即可超越手工制作的提示和其他优化器。
这篇论文提出SEED方法,通过自进化在线蒸馏将轨迹中的事后技能内化到模型参数中,解决长任务RL训练中奖励稀疏的问题,在ALFWorld等基准上取得了显著提升。
HealthClaw 是一个开源的代理架构,用于纵向个人健康管理,它使用自进化记忆来改进对重复交互的支持,在生物医学任务中实现了比基线更高的准确性和隐私性。
提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。
提出了EVOQUANT,一个自我进化的框架,利用LLM和验证器流水线自动化量化交易策略优化,在A股和加密货币市场上实现了夏普比率的显著提升。
介绍Critic Experience Bank (CEB),一个用于LLM智能体逐步置信度估计的自我演进批评框架,利用过去判断和后果的记忆库来改进校准,无需训练。