@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
摘要
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
查看缓存全文
缓存时间: 2026/06/10 00:17
Self-Harness: 自动改进自身的运行框架
(请收藏本文)
如今我们依赖的大部分智能体 scaffold(支撑框架)都是一次性构建完成,之后便冻结或几乎不再改变。
运行框架和技能一样,也需要随着新模型而进化。
如果 scaffold 能重写自身会怎样?
这项新工作将模型周围的运行框架(包括提示词、工具、控制流程)视为一种可学习的产物,它能从自身的运行中改进,而非停留在你手动维护的固定包装上。
这样一来,运行框架就变成了一个能不断积累收益的组件,随着一次次运行持续优化。如果你运行的是长周期智能体,一个能自我修改的运行框架就能将框架维护从人工工作转变为系统自主完成的任务。
论文链接:https://arxiv.org/abs/2606.09498
在我们的学院中学习如何构建有效的 AI 智能体:https://academy.dair.ai
Self-Harness: 自动改进自身的运行框架
来源:https://arxiv.org/html/2606.09498 Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu¹¹ 上海人工智能实验室 {zhanghangfan,zhangshao,hushuyue}@pjlab.org.cn
摘要
基于 LLM 的智能体的性能由基础模型和调节其与环境交互的运行框架共同决定。由于不同模型展现出不同的行为,有效的运行框架设计本质上是模型特定的。然而,智能体运行框架在很大程度上仍由人类专家设计,这种范式在面对日益多样且快速发展的现代 LLM 时扩展性很差。在本文中,我们引入了 Self-Harness,一种新的范式,其中基于 LLM 的智能体改进自身的运行框架,无需依赖人类工程师或更强的外部智能体。我们将 Self-Harness 实现为一个包含三个阶段迭代循环:弱点挖掘,从执行轨迹中识别模型特定的失败模式;框架提议,根据这些失败生成多样且最小的框架修改;以及提议验证,仅当候选编辑通过回归测试后才被接受。我们在 Terminal-Bench-2.0 上使用最小的初始框架和三个来自不同家族的基础模型(MiniMax M2.5、Qwen3.5-35B-A3B 和 GLM-5)实例化了 Self-Harness。在所有三个模型上,Self-Harness 都一致地提升了性能,保持任务的通过率分别从 40.5% 提高到 61.9%,从 23.8% 提高到 38.1%,以及从 42.9% 提高到 57.1%。定性分析进一步表明,Self-Harness 不仅仅添加通用指令,而是有效地将模型特定的弱点转化为具体、可执行的框架更改。这些结果指向一条路径:基于 LLM 的智能体不仅受其框架塑造,还能主动参与对框架的重新塑造。
对于有意识的生命而言,存在即变化,变化即成熟,成熟即不断地自我创造。——亨利·柏格森,《创造进化论》
1 引言
迄今为止,基于 LLM 的智能体不仅由其基础模型塑造,还由其运行框架塑造:即围绕模型并调节其与环境交互的系统。尽管没有普遍接受的定义,但运行框架可能包括系统提示、工具、运行时机制、验证规则、编排逻辑和故障恢复程序。因此,同一个基础模型在不同的运行框架下可能表现出截然不同的性能[28, 5, 8]。
从早期的 ReAct 等框架到 Claude Code、Codex 和 OpenHands 等产品或平台级系统,运行框架在很大程度上一直由人类专家设计[9, 16, 24, 36, 35]。虽然有效,但这种以人为中心的范式在应对现代 LLM 的多样性和快速演进时扩展性很差。不同模型可能展现出不同的行为模式、工具使用习惯、错误模式和对提示的敏感性[22, 21, 18];因此,对一个模型效果良好的运行框架可能对另一个模型并非最优[22, 5, 8]。随着新模型持续快速发布,为每个模型手动重新设计和调整模型特定的运行框架变得越来越昂贵且难以为继。
在本文中,我们探索一种新的范式——Self-Harness:使基于 LLM 的智能体能够改进其自身运行所依赖的框架(图1)。与近期使用更强外部智能体来改进较弱智能体框架的方法不同[5, 8],Self-Harness 力图将这一改进循环内化到目标智能体本身。这种范式减少了对可能昂贵、无法用于前沿模型或与目标模型失败模式不匹配的外部指导的依赖。更广泛地说,用柏格森的话来讲,这指向了一种自我创造的技术类比:一个系统不是外部改变的结果,而是持续“创造自身”。
我们将 Self-Harness 具象化为一个改进循环,该循环反复将行为证据转化为框架更新(图2)。该循环包含三个阶段。 弱点挖掘:从初始框架出发,使用固定模型的智能体在一组任务上运行,产生带有可验证结果的执行轨迹。然后智能体对失败的轨迹进行聚类,从而能够推理模型特定的失败模式,而非孤立的错误。 框架提议:基于这些失败模式,智能体生成一小部分多样且最小的框架修改,每个修改针对特定的失败机制。这一约束确保提议的编辑保持针对性,而非过于泛化。 提议验证:候选修改通过回归测试进行评估,仅当编辑在不导致保留任务可衡量性能下降的情况下提升性能时才被采纳。如果有多个候选修改通过回归测试,它们将被合并到下一个版本的框架中,该框架随后作为下一次迭代的起点。
在我们的实验中,我们使用最小的初始框架(图3)和三个来自不同家族的基础模型(MiniMax M2.5、Qwen3.5-35B-A3B 和 GLM-5)实例化了 Self-Harness[2, 20, 14]。在 Terminal-Bench-2.0 上,Self-Harness 在所有三个模型上一致地提升了性能(图4)。对于内部保留任务(其执行轨迹输入给评估系统),通过率分别从 43.0% 提高到 50.0%(MiniMax M2.5)、从 15.1% 提高到 36.0%(Qwen3.5-35B-A3B)以及从 47.7% 提高到 57.0%(GLM-5)。对于外部保留任务(其执行轨迹从未用作评估系统的输入),改进依然显著。通过率分别从 40.5% 提高到 61.9%(MiniMax M2.5)、从 23.8% 提高到 38.1%(Qwen3.5-35B-A3B)以及从 42.9% 提高到 57.1%(GLM-5)。这些结果表明,Self-Harness 能够将一个初始框架演化为更适合不同基础模型的模型特定框架。此外,它能够发现可广泛适用、泛化到未见任务而非仅仅过拟合观察到评估失败的框架修改。
定性分析进一步表明,Self-Harness 不仅仅让提示变长或添加通用指令。相反,它引入了反映每个模型在执行过程中反复出现问题的针对性更改,将模型特定的弱点转化为具体的框架级干预措施。对于 MiniMax M2.5,更改鼓励智能体更早创建所需的输出文件,更小心地处理结构化工具输出,并在工具使用循环变得过长之前停止无用的循环。对于 Qwen3.5-35B-A3B,更改侧重于提前检查依赖关系、避免重复执行失败命令、打破无休止探索的循环,并在工具出错后提醒智能体生成所需的产品。对于 GLM-5,更改主要帮助智能体跨 shell 命令保持环境设置,并更快地从探索转向实现和测试。值得注意的是,Self-Harness 还可以引入更广泛的结构性机制,例如基于子智能体的分解和中间件创建,这些超出了局部故障修复,改进了问题解决的整体组织。
总之,我们的主要贡献如下:
- 我们提出了 Self-Harness,一种用于框架改进的新范式,它使基于 LLM 的智能体能够设计和优化其自身的运行框架,针对其自身的基础模型进行调整,无需人工工程努力或更强外部智能体的指导。
- 我们将 Self-Harness 实现为一个迭代循环,将每个模型的行为证据转化为模型特定的框架更新:它评估执行轨迹以识别重复的失败模式,生成多样且最小的候选编辑,并且仅提升那些通过回归测试的编辑。
- 在 Terminal-Bench-2.0 上的实验表明,Self-Harness 在来自不同家族的三个模型上均提升了性能,绝对提升高达 21.4 个百分点,相对提升高达 138%;定性分析进一步证实,不同模型受益于不同的框架更改,表明 Self-Harness 能够将模型特定的弱点转化为具体的框架更改。
2 背景与相关工作
从提示到智能体运行框架。
提示工程和上下文工程表明,固定的模型可以通过指令、演示、检索到的证据、记忆、工具状态和动态构建的输入来引导[10, 25, 21, 6, 17, 12, 26, 7]。智能体系统将这个控制面从单个输入扩展到一个执行环境:模型行动、观察结果、使用工具、接收反馈并遵循运行时策略。ReAct、SWE-agent、Claude Code 和 SemaClaw/OpenClaw 展示了这种周围机制如何塑造长周期智能体行为和软件工程性能[29, 28, 9, 36]。
我们使用 运行框架 来指代这一周围的系统层:提示、工具、记忆、验证规则、权限策略、适配器和运行时机制,它们调节模型与环境之间的交互。许多重要的智能体失败是这一层的失败,而非孤立模型响应的失败:智能体可能在不检查产品的情况下报告成功,重试无价值的动作模式,在长上下文中丢失事实来源,或者缺乏恢复动作。这些行为来自指令、观察、工具和运行时控制之间的交互,因此改进它们需要改变的不仅仅是提示文本。
自我改进的智能体与自动化智能体设计。
越来越多的研究关注随着时间的推移适应其输入、记忆、上下文或工作流的系统[23, 32, 34, 31]。Reflexion 存储口头反馈以供后续尝试[23];智能体上下文工程为后续模型调用演化上下文[34];STOP 研究代码生成的递归自我改进[31]。这些方法表明,固定模型可以从累积的反馈中获益,但调整的对象通常是响应策略、记忆、上下文或生成的程序,而不是声明的智能体运行框架状态。
第二条线从被评估的智能体外部优化智能体设计。智能体系统的自动设计搜索智能体设计[3],语言智能体可以表示为可优化图[37],而 Meta-Harness 直接使用源代码、分数和先前候选的轨迹优化运行框架代码[5]。这些系统推动了框架级优化,但它们将改进框定为一种外部搜索或优化过程,而不是由被评估模型在其当前框架下提出的有边界编辑。
最后,科学发现和自我进化智能体系统,如 The AI Scientist、AI Scientist-v2、AlphaEvolve、Alita、Godel Agent 和 Darwin Godel Machine,自动化了更广泛的研究、算法设计或能力扩展循环[11, 27, 15, 19, 30, 33, 1]。Self-Harness 在精神上最接近这些自我改进文献和自动化运行框架优化,但它研究了一个更狭窄的受控设置:相同的固定模型,在当前运行框架下运行时,能否提出一个有边界的候选更改来改变支配其未来行为的框架。
3 Self-Harness:模型特定运行框架改进的迭代循环
人工运行框架工程通过专家检查和手动修改来改进智能体运行框架,而外部优化器方法将运行框架设计选择视为可搜索的空间。Self-Harness 研究了一种中间立场:固定模型通过一个由执行证据驱动的显式自我改进循环,迭代地改进自身周围的运行框架。在每次迭代中,评估系统运行当前框架,并从聚类的执行轨迹中挖掘重复的失败模式,以生成结构化的证据。基于这些证据,同一个模型被调用为提议者角色,生成一组多样且最小的候选运行框架修改,每个修改针对特定的失败机制,而不替换整体控制架构。然后通过对外部保留任务进行回归测试来验证候选编辑。
相似文章
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
@omarsar0: 用工具解决递归自我改进问题。我使用的代理工具面临的重大问题是:它如何支持…
exo 是一个新开源代理工具,旨在通过提供持久状态管理、事件日志记录、分叉和回滚功能来解决 AI 代理系统中的递归自我改进问题。
最好的智能代理工具会这样做……
作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。
@dair_ai: // 状态外部化框架 // 关于如何有效构建代理和框架的一种新范式正在兴起。如果……
Harness-1 引入了一种状态外部化框架,将常规记账与搜索代理中的策略决策分离,使一个 20B 模型在多个基准测试中超越更大的前沿搜索器。