DarwinX:通过自然选择进化智能体框架

Hugging Face Daily Papers 论文

摘要

DarwinX 通过自然选择式的种群搜索进化 LLM 智能体框架,模型权重保持冻结,在不做基准特定修补的情况下,提升了多个基准测试上的验证性能。

LLM 智能体的能力不仅取决于模型权重,还取决于其智能体框架:提示词、工具、技能和控制流。自我改进循环已经在编辑框架,但单一路径搜索具有路径依赖性,且局部胜利常常使其他任务回退。我们提出了 DarwinX,它将自我进化视为在模型冻结的情况下对框架种群进行选择:一种“保留并扩展”协议只接受在不回退的情况下扩大覆盖范围的变体;存档机制保留备选谱系以供重组;来自失败、教师和自身的证据共享一个编辑接口。适应度来自每个基准测试自带的验证器:没有金标准答案,也没有人为挑选的胜者。在四个逐步将进化信号与测试分离的基准测试上,单轮进化平均提高约 17 个百分点:Terminal-Bench 2.1 在匹配基座上提升 7.7 个百分点至 83.2%,在更强基座上达到已验证前沿的 84.7%;TerminalWorld 的留出集达到 68.3%,领先所有现成智能体;WebArena-Infinity 的真实任务 pass@1 从 43.5% 升至 93.0%,且审计干净;一个 Terminal-Bench 2.1 框架无需修改即可迁移到 SWE-bench Verified。进化出的是通用的智能体能力,而非针对特定基准的补丁,因此它能经受任务、验证器和基座模型的变化。冻结模型不一定是固定智能体:框架选择将评估算力转化为持久能力。
查看原文
查看缓存全文

缓存时间: 2026/08/14 03:25

论文页面 - DarwinX:通过自然选择进化智能体框架

来源:https://huggingface.co/papers/2608.07545

作者:

,

,

,

,

,

,

,

,

, ,

摘要

DarwinX 通过冻结模型进行种群选择来进化智能体框架,在不依赖特定基准修补的情况下,提升跨基准的已验证性能。

一个 LLM 智能体 的能力不仅取决于模型权重,还取决于其 智能体框架:提示词、工具、技能和控制流。自我改进循环已经在编辑[智能体框架](https://huggingface.co/papers?q=

相似文章

重新审视智能体框架演进的评估

arXiv cs.AI

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。

HarnessX:可组合、自适应且可演进的智能体夹具工坊

Hugging Face Daily Papers

HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

重新思考智能体工具框架进化的评估

Hugging Face Daily Papers

本文重新思考了智能体自动工具框架进化应如何评估,指出性能提升可能源于增加的计算量而非真正的改进,并且进化后的工具框架难以泛化到未见过的任务。

@NFTCPS: HarnessX这玩意儿挺有意思:一个能自己改自己的智能体架构。 以前架构怎么变,全靠人手调。新模型一出,Anthropic就把Claude Code里的规划步骤砍了,Manus半年重构了五次智能体,每次都在做减法。改什么、什么时候改,一…

X AI KOLs Timeline

HarnessX introduces a framework for self-evolving AI agent harnesses that treats the runtime harness as a first-class object, enabling automatic adaptation via trace-driven reinforcement learning. It achieves average gains of +14.5% across five benchmarks, with larger improvements for weaker models.