标签
This paper introduces SkillMisevo-Gym and SkillMisevo-Bench to study how self-improving LLM agents can evolve unsafe skills from compromised experience, plus SafeEvolve as a mitigation wrapper. Experiments across 25 agent-method configurations show skill misevolution is widespread and can persist across sessions, though SafeEvolve reduces fresh-session harm significantly.
本文提出了一种自我改进的“研究者智能体”,用于知识图谱上的Text-to-SPARQL问答,该智能体能迭代优化自身的提示和工具。在DBpedia上进行评估,达到了0.22的准确率,并识别出谓词选择是主要瓶颈。
斯坦福大学在 YouTube 上发布了研究生课程 CS329A: Self-Improving AI Agents 的完整录像,共 9 讲,涵盖测试时计算、验证器、强化学习、工具反馈、多步推理等主题,系统梳理了 Agent 自进化方向。
论文《Memory Reward Inflation in Self-Improving LLM Agents》表明,权重冻结的自我改进智能体仍可能因信任有缺陷的LLM生成的记忆分数而退化,模型认可自身31%–54%的错误答案。这种“回声差距”在更强的LLM中依然存在。
一条推文讨论了自我改进智能体缺失的部分:一个严格的审查关卡,要求经验丰富的工程师必须批准每个技能。它解释了不断增长的库如何提高发现和提取质量,由人类批准所有合并以保持系统的可信度。
本文提出了一种在自我改进的大语言模型代理系统中协同进化评估指标和技能的方法,展示了指标是可以进化的,并且协同进化方法在代码生成、文本到SQL和报告生成任务中恢复了大部分由真实标签驱动的性能。
Prime Intellect Lab 已结束测试,提供平台用于训练模型,支持多种架构和模态,助力自我改进的智能体。
本周精选五篇值得关注的AI文章,涵盖自我改进代理、Bun向Rust迁移、vLLM架构、编码评估基准以及代理自主性等级。
Anthropic 和 Google 发布了三个免费的研讨会,主题是从头构建自我改进的智能体系统,涵盖多智能体的陷阱、技能差距以及构建自主智能体。
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。
Introspection是一家由前xAI工程师创立的新AI初创公司,它推出了'autoresearch'——一种反馈循环系统,智能体通过信号、评估和人类输入来维护并完善自身,超越了传统的智能体框架。
一份实用指南,解释了构建自我改进AI智能体的三个层级,从手动循环到自动化设计,并推荐了工具和框架。
一家一人公司完全由7个AI代理、10个定时任务运行,没有人类员工。这些代理通过Telegram自我评估和改进。
这篇论文提出了一种自我改进智能体的新颖蓝图,通过元智能体和反馈智能体结合支架编辑和权重训练,在AlphaFold的CUDA内核上实现了14倍加速。
本文介绍了红皇后哥德尔机(RQGM),这是一个在非平稳效用下进行递归自我改进的进化框架,其中智能体和评估者共同进化,提高了在编程任务、科学写作和奥林匹克级证明评分方面的性能。
本文介绍了Regimes,一种基于ActiveGraph运行时的可审计、保留门控改进循环,用于自我改进代理。它通过在LongMemEval数据集上自主发现通过静态检查、沙盒执行和保留验证的提示修复,展示了适度的改进。
EEVEE是一种新颖的测试时提示学习框架,专为LLM代理设计,通过任务聚类和共同演化的路由器-提示优化来处理异构数据流,在多个基准测试上实现了显著优于现有方法的改进。
本周一篇重要的AI论文探讨了自我改进智能体是否真正发现新知识,还是仅仅在重新混合现有信息。
本文介绍了一个范畴论框架,用于区分自我改进的AI智能体中的真正科学发现与单纯的检索或搜索,利用范畴论来形式化状态转变。作者通过一个蛋白质力学示例展示了该框架:智能体在解决更难的问题时准确率下降,但其理论压缩了更多数据,表明真正的发现。
本文厘清了自我改进的LLM智能体中进化器与智能体的角色,表明一个小型进化器可以编写足够好的更新,而中端智能体最能从中受益。论文建议将最强的模型用作任务执行器,而非更新编写器。