@qingke_ai: https://x.com/qingke_ai/status/2076115489219297455
Summary
普林斯顿博士后Shilong Liu提出自进化代理的三层分类体系:工件迭代优化、Agent Harness自我改进和无黄金答案的模型学习,系统梳理了相关概念和前沿工作。
View Cached Full Text
Cached at: 07/12/26, 10:52 AM
Models、Harness 和 Artifacts,到底是什么在进化?普林斯顿博士后拆解 Agent 自进化的三层分类体系
作者:Shilong Liu,普林斯顿博士后,哥大助理教授(拟入职) https://lsl.zone/blog/2026/a-taxonomy-of-self-evolving-agents/
英文版原文
Shilong Liu@Shilong_Liu_AI·Jul 8 ArticleA Taxonomy of Self-evolving AgentsSelf-evolving agents are becoming popular. Hermes Agent enables automatic reusable skills. RSI Lab tries to discover new algorithms recursively….99948065K
自进化代理(Self-evolving Agent)正在日益流行。
Hermes Agent支持自动生成可复用的技能。RSI Lab尝试循环地发现新算法。NVIDIA正在探索机器人领域的 Agent 式自进化。自动研究代理旨在通过自进化实现现实科学发现。越来越多的论文也在设计自进化算法,包括强化学习(RL)和无训练方法。
它们都使用相似的词汇:自我进化、自我改进、学习、适应。但它们指的是同一件事吗?我们应该如何将这些工作分类到不同的方向?它们与“自我改进代理”、“递归自我改进”、“持续学习”和“测试时训练”等相关术语有什么区别?
在这篇博客中,我通过回答这些问题,为自我进化的代理提供了一个分类体系。
模型(Models)、线束和文物
模型(Models)、Harness 和 Artifacts 是自进化系统中的三个关键要素。
模型(通常是大型语言模型LLM)是大脑,用于响应提示。Harness包括循环设计、记忆、工具和其他外围组件,将会把模型转变为Agent。因此有一个著名的等式:
工件突然被提及。我用“工件”进行指代代理产生的输出,例如代理发现的内核算法,自动拓扑的论文和发现,或机器人自进化系统产生的新机器人策略。
三者之间的联系很简单:模型和Harness共同构成Agent,Agent首先产生Artifacts。这三个术语为我们组织自进化系统提供了一个有用的框架。
基于这个视角,现有的自演化系统可以分为三个层次:工件迭代优化、利用自改进和无黄金答案的模型学习。
一、工件迭代优化
最近这波自进化代理浪潮,主要由Artifacts迭代优化推动。其动机很简单:利用强大的LLM为复杂优化问题创建新的Artifacts。
AlphaEvolve利用编码代理进行科学和算法发现。在这个分类中,发现的算法就是 Artifacts。同时出现了几个自动研究系统。
其中一个标志性事件是Analemma AI的FARS,运行了417小时,增量了166篇完全由AI生成的论文,成本约18万美元。递归超级智能也发现了更好的GPU内核算法。
工件迭代优化系统概念上并不复杂。人类设定目标并评估标准,然后 Agent 反复寻找改进点,产生新的输出,并检查是否符合标准。如果符合,过程结束;否则循环继续。上面的 AlphaEvolve 流程就是一个例子。
读者可能已经熟悉这种模式,因为 Codex、Claude Code 和 OpenClaw 等工具都遵循类似的行为。
这个想法很有洞察力,当然也不新鲜。改变的是LLM(尤其是编码模型)让这个循环变得更加灵活。
在很多LLM主导之前,预设通常会手工设计算子或动作,然后在这些算子上设计搜索或优化方法。神经架构就是搜索一个很好的例子。EfficientNet定义了可能的网络子算搜索空间,搜索更好的网络设计。然后这些工作在任务上就取得了成功,有时甚至超越了人类设计的算法。
LLM带来的改变是,模型本身可以同时充当算子和优化器。它可以发明新的候选方案,检查之前的结果,并下一步搜索方向。这使其成为强大的搜索工具。我们获得了更大的搜索空间和更好的启发式搜索器。
另一个趋势是LLM在较长的人工任务上变得更强。因此,改进-验证循环可以更有效地运行。就在2024年(两年前),像LLaVA-Plus这样的早期工作只能进行少5次工具调用,需要间隙的人类干预。
但现在,特工运行数小时,几乎不需要人类干预。随着更强大的大模型,这种循环对加速工程和科学发现变得非常有用。
目前大多数 Agent 在数字环境中运行:代码库、浏览器、模拟器、终端和其他软件系统。因此,大多数探索仍然局限于虚拟环境。更雄心勃勃的方向是现实世界。
NVIDIA让 Agent 通过 Agent 循环控制机器人来发现新的机器人策略。LabOS将 Agent 与生物实验室连接进行实验。Qumus构建了一个量子材料实验员。 展望未来的方式,我们应该期待更多在物理世界中进行人工制品迭代优化的工作。
世界就是特工们的牡蛎。(世界就是特工们的舞台)
二、Agent Harness自我改进
几乎与Artifacts迭代优化训练同时,Agent Harness自我改进在研究中流行起来。动机不同:模型成本增加,因此一个自然的问题是,我们是否可以在不更新模型权重的情况下,在以后部署改进Agent。
答案似乎是肯定的。优秀的思维倾向于对每个有价值的问题先说“是”,至少先给出一个演讲。探索的两个解决方案是:提示/主要记忆层面,以及工具/技能层面。
提示学习和记忆
我们可以记住一些问题和答案,以便以后回答相同的问题。我中学时就这样做过。但记忆泛化能力差,在类似但不同的任务上表现不佳。更好的解决方案是提取有用的规则,并存储在代理可以复用的位置。
-
GEPA将规则嵌入提示词
-
ACE存储至操作手册(Playbook)
-
Mem0搭建专用记忆存储系统
虽然有些方法名字里标注着“学习”,但它们并没有调整模型权重。但如果我们把 Harness 看作 Agent 的一部分,那么对 Harness 的更新(如提示更新)就应该被看作类似参数更新的操作。因此,将它们称为“学习”方法并无妥当。
这是 Agent Harness 自我改进与 Artifacts 迭代优化的另一个关键区别。在这里,Agent 修改自己的组件(如提示和记忆),而 Artifacts 迭代优化关注的是优化输出而不是 Agent 本身。
工具和技能创造
但文本信息并不总是足够的。例如,如果 Agent 需要理解一段长视频并找到关键帧,仅靠记忆可能会变得稳健。要提取关键帧,Agent 需要执行的工具或技能。因此,一个直接的想法是创建可复用的工具(如Alita)或技能(如Mem-UI),这样 Agent 在重复使用时就会遇到相同的问题。
工具以代码形式编码,Agent可以直接生成它们。skill可以看作是围绕工具的高级包装。生成后,这些工具或skill会被添加到Agent中,Agent接下来就可以复用它们解决类似的问题。
技能也可以看作是另一种上下文管理方式。它们减少了上下文长度,因为Agent不再需要把每个细节都塞进上下文窗口。上下文很重要。
技能已成为当前流行的解决方案。Claude Code 已将技能形式化,并成为现代代理的事实标准组件。Claude Code 可以创建和使用技能,Codex 和 OpenClaw 也是。如此另一个热门仓库 Hermes Agent 也突出了自动技能创建。
与提示学习和记忆类似,这需要代理修改自身,因为工具和技能属于驾驭。
方向多 Agent 自进化
前面的解决方案很优雅,但难以在单个代理内扩展。随着脚本增长、工具和技能增加,系统会变得不可靠且效率低下。如果用户只关心股票相关问题,他们不需要烹饪工具。在系统中保留无关工具让代理变慢,有时只会更困惑。这个困惑也可能是语义上的:如果向同一个代理注入太多烹饪知识,代理可能不知道“挤压”指的是股市还是橙子。
为此,限制任务专家变得有用。有时一个烹饪 Agent 和一个股票 Agent 比一个尝试同时处理两个领域的 Agent 更好。这引发了多 Agent 自进化解决方案。我们之前的工作Eevee观察到,当数据来自非常不同的来源或分配时,单个 Agent 会受到。
因此提出使用多个专家Agent处理不同的任务,由路由器将每个任务分配给合适的专家。同样,我们发现为Agent配备一组生成的工具来构建专家,在某些专业领域非常有用,例如Alita-G。
我们也可以将多代理系统视为上下文管理的扩展,因为每个专家都提出了其自身任务有用的上下文。上下文很重要。
对于多Agent解决方案,关键瓶颈是如何找到合适的Agent,即路由问题。一个关键发现是,在大多数情况下下路由并不是简单的问题。它需要更强的基础模型才能获得良好的性能,如路由所示。从这个意义上来说,人类专家最有价值的能力也是路由之一。我们将任务替换Agent,并决定它们是否应该进入下一步。
人类就是一个路由器。
三、无黄金答案的模型学习
这是第三个方向。与Artifacts优化和Harness自改进相比,这个方向直接更新模型本身。该领域的许多工作可能从未自称“自进化代理”。
它们通常出现在自训练(Self-Training)、弱监督(Weak Supervision)、自博弈(Self-Play)、强化学习(RL)、测试时训练(TTT)、在线学习(Online Learning)或持续学习(Continual Learning)等名称下。
关键区别在于学习将改变模型权重。问题是如何在没有黄金答案、只有问题、弱信号或可选环境访问的情况下实现模型更新。目标与自进化代理类似,但解决方案不同。
伪真值或内部信号
如果没有黄金答案,一个选项是从数据本身构建伪真值(如自我训练),或使用内部信号(如TTLL)。
这些信号可用于模型训练。如果将α标签视为目标,我们可以使用监督(SFT)。如果信号可以转化为奖励,我们可以使用RL,如DeepSeek-R1。
例如,假设有一个问题:图片有多少个苹果?虽然我们的真值,但预模型训练仍然可能比随机猜测给出更好的估计。假设图片有 5 个苹果,模型可能对“4、5、6 个苹果”的答案更有置信度,这些就是内部信号。这些信号不是完美的标签,但仍然是有用的信息。
自博弈和来自环境的弱信号
学习信号也可以来自模型外部。有些例子使用自博弈进行学习,例如SPIN和绝对零。其他通过与环境交互学习,例如通过早期经验进行代理学习。我将它们归为一类,因为另一个玩家也可以视为环境的一部分。
有一个简单的日常例子:如果你约别人出去玩没有收到回复,这仍然给你提供了信息。即使环境却没有响应,也是一个弱信号。
模型架构测试时训练(TTT)
测试时训练(TTT)是一个特例。我把它列在这里是因为它试图解决类似的问题,但方式非常不同。它从来没有自称自进化。可能的原因是它有一个更花哨的名字。
这是一系列工作。该方向表明,某些模型可以在推理过程中被解释为执行某种基于梯度的序列更新。从这个意义上说,模型可以看作在推理过程中持续更新一个矩阵。我推荐阅读这篇DeltaNet博客。
与持续学习的联系
持续学习(Continual Learning,在某些语境中也被称为在线学习或终身学习)可以追溯到LLM时代之前。经典场景是视觉识别:假设我们训练了一辆模型识别轿车,现在让它识别SUV。
简单的方案是在SUV图像上改装模型,但可能会损害它对原有轿车图像的识别能力。如何避免灾难性遗忘(Catastropicic Forgetting)就成为关键问题。很难说这个问题已经完全解决。最有效的解决方案之一(也许唯一有效的)仍然是在SUV上改装时重放一些轿车样本。
然而,同一个模式术语在不同时期可能有不同的含义。“多态”学习完全是一个好例子。
-
2017年左右,它常指图像工作描述(如Bottom-Up和Top-Down Attention);
-
2021年左右,常指CLIP类模型;
-
2023年,用于GPT-4V等视觉-语言模型;
-
到2025年,它仍然以同时处理图像理解和生成的统一模型为主题。
-
,今天LLM讨论中的“持续学习”往往更接近自进化代理,而非早期的灾难性同样存在设置。
人类和术语都会随着时间而改变。
四、模糊的边界
模型、Harness 和 Artifacts 演化之间的边界正在变得模糊。当我们优化内核算法时,目标是 Artifact。但为了让搜索更有效,可能还需要改进 Agent 自身的设计,如、工具、记忆或搜索策略。
代理的知识设定于模型的预训练。一旦驾驭达到极限,更新模型参数就成为同样自然的下一步。一些最近的工作如SIA已经探索了这个方向。
展望未来,我认为自进化系统中的每个模块都应该一起改进。
了解AI工具进步的一个有用的方式是抽象。几年前,我们自己写每一行代码。后来我们让ChatGPT写代码片段。再后来Copilot帮助写函数和文件。今天,编码代理处理整个项目。优化目标可以从单词,变成了片段、文件,现在是整个项目。我们不断将更多项组合在一起,给它们一个新的抽象,并在更高层次思考。
自进化Agent系统也应该同样发生的事情。模型、Harness和Artifact不应该永远被视为孤立的组件。一旦系统足够强大,自然的方向就是将它们作为一个统一的进化系统一起改进。
五、面向现实世界
Agent 自进化最令人期待的部分,是它们改进 Agent 系统自身之外的事物的能力。
更好的提示有用。更好的记忆有用。更好的工具有用。更好的模型也有用。但自进化的最终价值,仍然取决于它是否有助于我们构建更好的东西来简化:更快的内核、更好的软件、新的科学假设、新材料,以及更好的机器人。
这就是我用模型、挽具和神器来组织这个领域的原因。它们描述了进化可能发生的三个地方:
-
模型可以从弱信号中学习;
-
Harness可以更新其记忆、提示、工具和技能;
-
Artifact可以被Agent迭代优化。
这三个层次是通往同一个更大系统的不同入口点。
在早期系统中,这些循环通常单独出现。有些工作保持模型固定而改进Harness;有些保持代理固定而改进Artifact;有些用自生成或弱反馈训练模型。
在未来的系统中,它们很可能会共同成长。更好的模型有助于构建更好的框架;更好的框架加速工件搜索;更好的工件为模型学习创建新的数据和反馈。
自进化代理的想法过去以不同的名称出现过多次:递归自我改进、发现持续学习、在线学习、自动、测试时适应。名称改变是因为可用系统改变了。今天我们有了大模型、工具使用代理、工具执行、更丰富的环境和更有用的验证信号。
对于争论的名称,我觉得更有用的是问三个简单的问题:
1、什么在进化? 2、什么反馈驱动它? 3、循环在哪里闭合?
如果在基准测试上循环,我们得到更好的基准运动器;如果在代码改进上,我们得到更好的软件;如果在科学和工程上得到更好的发现;如果在物理世界上得到更好的发现;如果在物理世界上,代理可能成为构建和真实系统的新方式。
世界仍然是最困难的环境。它也是自进化主体最重要发挥作用的地方。
Similar Articles
@qinzytech: https://x.com/qinzytech/status/2066585405479371092
A technical analysis of two approaches to building self-evolving AI agents: model-based (via architecture like SSMs or transformer with fast-weight updates, and training methods) and harness-based (via memory or meta harness that can rewrite itself). The author provides practical recommendations for different audiences.
@snowboat84: https://x.com/snowboat84/status/2065215177029787705
This article is the middle part of the AI Engineering Landscape series, detailing core techniques such as inference optimization, model slimming (quantization, distillation, pruning, MoE), and speculative decoding, while reviewing the latest advances from hardware to the engineering stack.
@Russell3402: https://x.com/Russell3402/status/2056331558223786416
This article delves into the division of labor design in multi-agent systems, including trigger mechanisms, topology structures, and call chains, analyzing the engineering practices of systems such as Codex, Claude Code, OpenClaw, and Hermes Agent.
@Smartpigai: https://x.com/Smartpigai/status/2064209609896968679
This article explores the view that in the Agent era, Loop Engineering is more important than Prompt Engineering. The author believes that the core capability of an AI Agent lies not in the model itself, but in the feedback loop system built around the model, which determines whether the Agent can continuously improve and approach the correct answer.
@AxtonLiu: https://x.com/AxtonLiu/status/2073791557547794579
This article discusses the concept of Agent OS, emphasizing the division of tasks into multiple workstations (fetch, refine, verify, confirm) through specialization, each managed by an independent Agent to achieve controllable automation. The author uses the example of digesting browser tabs to demonstrate how specialization isolates context, responsibility, and risks, ensuring the accuracy and reliability of AI output.