Self-Harness: 自我改进的Harness
摘要
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
暂无内容
查看缓存全文
缓存时间: 2026/06/24 19:53
# Self-Harness: 能够自我改进的操作框架
来源:https://arxiv.org/html/2606.09498
Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen,Yiqun Zhang,Lei Bai,Shuyue Hu11footnotemark:1 上海人工智能实验室 \{zhanghangfan,zhangshao,hushuyue\}@pjlab\.org\.cn
###### 摘要
基于LLM的智能体的性能由其基础模型和协调其与环境交互的操作框架共同决定。由于不同模型表现出不同的行为,有效的操作框架设计本质上具有模型特异性。然而,智能体操作框架在很大程度上仍由人类专家设计,这种范式在当代LLM日益多样化和快速演进的背景下,扩展性很差。在本文中,我们介绍*Self-Harness*,一种新的范式,其中基于LLM的智能体改进其自身的操作框架,无需依赖人类工程师或更强的外部智能体。我们将Self-Harness实现为一个迭代循环,包含三个阶段:弱点挖掘(Weakness Mining),从执行轨迹中识别模型特定的失败模式;操作框架提案(Harness Proposal),生成与这些失败相关的多样化且最小化的操作框架修改;以及提案验证(Proposal Validation),仅当候选编辑通过回归测试后才被接受。我们在Terminal-Bench-2.0上,使用一个最小的初始操作框架和三个来自不同家族的基础模型:MiniMax M2.5、Qwen3.5-35B-A3B和GLM-5,实例化了Self-Harness。在所有三个模型上,Self-Harness都持续提升了性能,留出通过率分别从40.5%提高到61.9%,从23.8%提高到38.1%,以及从42.9%提高到57.1%。定性分析进一步表明,Self-Harness不仅仅是添加通用指令,而是有效地将模型特定的弱点转化为具体、可执行的操作框架更改。这些结果表明了一条通往基于LLM的智能体的道路——它们不仅由操作框架塑造,还能够参与重塑操作框架。
> 对于一个有意识的存在而言,存在就是变化,变化就是成熟,成熟就是不断地自我创造。 ——亨利·柏格森,《创造进化论》
## 1引言
迄今为止,基于LLM的智能体不仅由其基础模型塑造,还由其*操作框架*(harness)塑造:即围绕模型并协调其与环境交互的系统。尽管没有普遍接受的定义,操作框架可能包括系统提示、工具、运行时机制、验证规则、编排逻辑和故障恢复程序。因此,相同的基础模型在不同的操作框架下可能表现出截然不同的性能\[28 (https://arxiv.org/html/2606.09498#bib.bib13),5 (https://arxiv.org/html/2606.09498#bib.bib23),8 (https://arxiv.org/html/2606.09498#bib.bib35)\]。
从早期的框架如ReAct\[29 (https://arxiv.org/html/2606.09498#bib.bib9)\]到产品和平台级系统如Claude Code、Codex和OpenHands,操作框架在很大程度上由人类专家设计\[9 (https://arxiv.org/html/2606.09498#bib.bib32),16 (https://arxiv.org/html/2606.09498#bib.bib29),24 (https://arxiv.org/html/2606.09498#bib.bib14),36 (https://arxiv.org/html/2606.09498#bib.bib33),35 (https://arxiv.org/html/2606.09498#bib.bib36)\]。虽然有效,但这种以人为中心的范式难以适应现代LLM的多样性和快速演进。不同模型可能表现出不同的行为模式、工具使用习惯、错误模式以及对提示的敏感性\[22 (https://arxiv.org/html/2606.09498#bib.bib3),21 (https://arxiv.org/html/2606.09498#bib.bib2),18 (https://arxiv.org/html/2606.09498#bib.bib12)\];因此,对一个模型有效的操作框架可能对另一个模型是次优的\[22 (https://arxiv.org/html/2606.09498#bib.bib3),5 (https://arxiv.org/html/2606.09498#bib.bib23),8 (https://arxiv.org/html/2606.09498#bib.bib35)\]。随着新模型以快速节奏持续发布,手动为每个模型重新设计和调整模型特定的操作框架变得日益昂贵且不可持续。
参见标题Figure 1:操作框架改进的三种范式。在人类操作框架工程中,人类工程师手动修改智能体操作框架。在元操作框架(Meta-Harness)中,一个更强的外部智能体指导较弱目标智能体的改进。在Self-Harness中,智能体改进其自身的操作框架。在本文中,我们探索一种新的范式,*Self-Harness*:使基于LLM的智能体能够改进其运行所依赖的操作框架(Figure1 (https://arxiv.org/html/2606.09498#S1.F1))。与最近使用更强的外部智能体来改进较弱智能体操作框架的方法\[5 (https://arxiv.org/html/2606.09498#bib.bib23),8 (https://arxiv.org/html/2606.09498#bib.bib35)\]不同,Self-Harness试图将这个改进循环内化到目标智能体自身中。这种范式减少了对可能昂贵、对前沿模型不可用或与目标模型失败模式不匹配的外部指导的依赖。更广泛地说,用柏格森的话来说,这指向了一种自我创造的技术类比:一个系统不仅仅是从外部被改变,而是持续地“创造自身”。
我们将Self-Harness实现为一个改进循环,反复将行为证据转化为操作框架更新(Figure2 (https://arxiv.org/html/2606.09498#S3.F2))。该循环由三个阶段组成。弱点挖掘:从一个初始操作框架开始,具有固定模型的智能体在一组任务上运行,产生具有可验证结果的执行轨迹。然后,智能体对失败的轨迹进行聚类,使其能够推理模型特定的失败模式,而不是孤立的错误。操作框架提案:基于这些失败模式,智能体生成一小组多样化但最小化的操作框架修改,每个修改都与特定的失败机制相关联。这个约束确保提议的编辑保持针对性,而不是过于通用。提案验证:候选修改通过回归测试进行评估,只有在改进性能且不会在未知任务上引起可测量的退化时,编辑才会被提升。如果多个候选修改通过回归测试,它们将被合并到操作框架的下一个版本中,然后作为下一次迭代的起点。
在我们的实验中,我们使用一个最小的初始操作框架(Figure3 (https://arxiv.org/html/2606.09498#S4.F3))和三个来自不同家族的基础模型:MiniMax M2.5、Qwen3.5-35B-A3B和GLM-5\[2 (https://arxiv.org/html/2606.09498#bib.bib31),20 (https://arxiv.org/html/2606.09498#bib.bib30),14 (https://arxiv.org/html/2606.09498#bib.bib28)\]来实例化Self-Harness。在Terminal-Bench-2.0上,Self-Harness在所有三个模型上持续提升性能(Figure4 (https://arxiv.org/html/2606.09498#S4.F4))。对于已知任务(held-in tasks),其执行轨迹提供给评估系统,通过率从MiniMax M2.5的43.0%提高到50.0%,从Qwen3.5-35B-A3B的15.1%提高到36.0%,从GLM-5的47.7%提高到57.0%。对于未知任务(held-out tasks),其执行轨迹从未用作评估系统的输入,改进仍然显著。通过率从MiniMax M2.5的40.5%提高到61.9%,从Qwen3.5-35B-A3B的23.8%提高到38.1%,从GLM-5的42.9%提高到57.1%。这些结果表明,Self-Harness可以将初始操作框架演变为更适合不同基础模型的模型特定操作框架。此外,它可以发现广泛有用的操作框架修改,这些修改能够泛化到未见过的任务,而不仅仅是过度拟合到观察到的评估失败。
定性分析进一步表明,Self-Harness所做的不仅仅是使提示更长或添加通用指令。相反,它引入了有针对性的更改,反映了每个模型在执行过程中遇到的重复问题,将模型特定的弱点转化为具体的操作框架层面的干预。对于MiniMax M2.5,更改鼓励智能体更早创建所需的输出文件,更仔细地处理结构化工具输出,并在无用的工具使用循环变得过长之前停止它们。对于Qwen3.5-35B-A3B,更改侧重于提前检查依赖关系,避免重复失败的命令,打破无休止探索的循环,并提醒智能体在工具错误后生成所需的工件。对于GLM-5,更改主要帮助智能体在shell命令之间保留环境设置,并从探索更快地转向实现和测试。值得注意的是,Self-Harness还可以引入更广泛的结构机制,例如基于子智能体的分解和中间件创建,这些超越了局部故障修复,改进了问题解决的整体组织。
总结一下,我们的主要贡献如下:
- •我们提出了Self-Harness,一种用于操作框架改进的新范式,使基于LLM的智能体能够设计和改进其运行所依赖的操作框架,针对其自身的基础模型进行定制,无需人工工程努力或来自更强外部智能体的指导。
- •我们将Self-Harness实现为一个迭代循环,将每个模型的行为证据转化为模型特定的操作框架更新:它评估执行轨迹以识别重复出现的失败模式,生成多样化但最小化的候选编辑,并且仅提升那些通过回归测试的编辑。
- •在Terminal-Bench-2.0上的实验表明,Self-Harness在三个来自不同家族的模型上提高了性能,绝对增益高达21.4个百分点,相对改进高达138%;定性分析进一步证实,不同的模型受益于不同的操作框架更改,这表明Self-Harness可以将模型特定的弱点转化为具体的操作框架更改。
## 2背景与相关工作
#### 从提示到智能体操作框架。
提示工程和上下文工程表明,固定模型可以通过指令、示范、检索到的证据、记忆、工具状态和动态构建的输入来引导\[10 (https://arxiv.org/html/2606.09498#bib.bib1),25 (https://arxiv.org/html/2606.09498#bib.bib4),21 (https://arxiv.org/html/2606.09498#bib.bib2),6 (https://arxiv.org/html/2606.09498#bib.bib5),17 (https://arxiv.org/html/2606.09498#bib.bib7),12 (https://arxiv.org/html/2606.09498#bib.bib8),26 (https://arxiv.org/html/2606.09498#bib.bib38),7 (https://arxiv.org/html/2606.09498#bib.bib39)\]。智能体系统将这个控制面从单个输入扩展到执行环境:模型行动、观察后果、使用工具、接收反馈并遵循运行时策略。ReAct、SWE-agent、Claude Code和SemaClaw/OpenClaw说明了这种周围机制如何塑造长期智能体行为和软件工程性能\[29 (https://arxiv.org/html/2606.09498#bib.bib9),28 (https://arxiv.org/html/2606.09498#bib.bib13),9 (https://arxiv.org/html/2606.09498#bib.bib32),36 (https://arxiv.org/html/2606.09498#bib.bib33)\]。
我们使用*操作框架*(harness)来表示这一周围系统层:提示、工具、记忆、验证规则、权限策略、适配器和运行时机制,它们协调模型与环境之间的交互。许多重要的智能体故障是这一层的故障,而不是孤立模型响应的故障:智能体可能未检查工件就报告成功,重试无效的行动模式,在长上下文中丢失真相源,或缺乏恢复行动。这些行为源于指令、观察、工具和运行时控制之间的交互,因此改进它们需要更改的不仅仅是提示文本。
#### 自我改进的智能体与自动智能体设计。
越来越多的研究关注那些随时间调整其输入、记忆、上下文或工作流程的系统\[23 (https://arxiv.org/html/2606.09498#bib.bib10),32 (https://arxiv.org/html/2606.09498#bib.bib40),34 (https://arxiv.org/html/2606.09498#bib.bib15),31 (https://arxiv.org/html/2606.09498#bib.bib20)\]。Reflexion存储后续尝试的口头反馈\[23 (https://arxiv.org/html/2606.09498#bib.bib10)\],智能体上下文工程为后续模型调用演化上下文\[34 (https://arxiv.org/html/2606.09498#bib.bib15)\],STOP研究代码生成的递归自我改进\[31 (https://arxiv.org/html/2606.09498#bib.bib20)\]。这些方法表明,固定模型可以从累积的反馈中受益,但适应对象通常是响应策略、记忆、上下文或生成的程序,而不是声明的智能体操作框架状态。
第二条线从被评估的智能体外部优化智能体设计。智能体系统的自动设计搜索智能体设计,语言智能体可以表示为可优化的图,元操作框架(Meta-Harness)直接使用先前候选的源代码、分数和轨迹来优化操作框架代码\[3 (https://arxiv.org/html/2606.09498#bib.bib21),37 (https://arxiv.org/html/2606.09498#bib.bib22),5 (https://arxiv.org/html/2606.09498#bib.bib23)\]。这些系统激发了操作框架级别的优化,但它们将改进框定为外部搜索或优化过程,而不是由被评估模型在其当前操作框架下提出的有限编辑。
最后,科学发现和自我进化智能体系统,如The AI Scientist、AI Scientist-v2、AlphaEvolve、Alita、Godel Agent和Darwin Godel Machine,自动化了研究、算法设计或能力扩展的更广泛循环\[11 (https://arxiv.org/html/2606.09498#bib.bib18),27 (https://arxiv.org/html/2606.09498#bib.bib19),15 (https://arxiv.org/html/2606.09498#bib.bib17),19 (https://arxiv.org/html/2606.09498#bib.bib16),30 (https://arxiv.org/html/2606.09498#bib.bib24),33 (https://arxiv.org/html/2606.09498#bib.bib25),1 (https://arxiv.org/html/2606.09498#bib.bib37)\]。Self-Harness在精神上最接近这个自我改进文献和自动操作框架优化,但它研究了一个更窄的控制设置:相同的固定模型,在当前操作框架下运行,能否对控制其自身未来行为的操作框架提出一个有限的候选更改。
## 3Self-Harness:模型特定操作框架改进的迭代循环
人类操作框架工程通过专家检查和手动修改来改进智能体操作框架,而外部优化器方法将操作框架设计选择视为可搜索的空间。Self-Harness研究了一个中间地带,其中固定模型通过一个由执行证据驱动的显式自我改进循环,迭代地改进围绕自身的操作框架。在每次迭代中,评估系统运行当前操作框架,并从聚类的执行轨迹中挖掘重复出现的失败模式,以产生结构化证据。给定这个证据,同一个模型以提议者角色被调用,生成一小组多样化但最小化的候选操作框架修改,每个修改针对一个特定的失败机制,而不替换整体控制架构。然后,通过对未知任务进行回归测试来验证候选编辑,并且一个明确的接受规则只提升那些提高性能而不引入不可接受退化的编辑。
### 3.1 预备知识
我们使用*操作框架*(harness)来表示控制固定语言模型如何被部署为智能体的非参数框架。操作框架包括指令、可用工具、记忆和状态管理机制等。操作框架不修改模型参数;相反,它规定了模型观察任务、采取行动、调用工具、检查中间工件和产生最终答案所遵循的执行协议。
形式化地,令MM为一个固定语言模型,令hh表示一个智能体操作框架。给定一个任务实例xx,在操作框架hh下运行MM会产生一个执行轨迹τ\\tau和一个输出yy。轨迹相似文章
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
工具更新并非工具收益:自进化LLM智能体中进化能力的解耦
本文分析了自进化LLM智能体中的两种能力:工具更新能力和工具收益能力。研究发现工具更新能力在不同基础能力层级间持平,而工具收益能力则呈现非单调性,其中中等层级模型收益最大。
最好的智能代理工具会这样做……
作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。