LemonHarness 技术报告

arXiv cs.AI 论文

摘要

本文介绍了 LemonHarness,一个面向长周期 LLM 智能体的集成执行框架。该框架将状态变更操作限制在清晰定义的 workspace 内,引入可复用的规则知识库,并增加了时间感知执行功能。在 Terminal-Bench 2.0 上实现了 84-86% 的准确率。

arXiv:2606.24311v1 Announce Type: new 摘要:随着大语言模型(LLM)智能体被应用于更长期的任务中,它们在多轮迭代中越来越多地修改工作区状态。然而,智能体通常仅能观察工具输出和日志片段,而实际的状态变更发生在文件系统中。由于没有明确的工作区边界,诸如文件写入和临时工件生成等状态变更操作可能会将变更分散到各个路径。随着时间的推移,这些弱约束变更不断累积,使得修改后的文件等状态难以追踪。本文提出了 LemonHarness,一个用于长周期智能体的集成执行框架。LemonHarness 通过将状态变更操作限制在清晰定义的工作区内,并将模型调用、工具执行和规则知识整合到一个受控边界内,建立了明确的执行边界。包括文件写入、依赖安装和临时工件创建在内的状态变更操作通过结构化工具接口执行,执行反馈以观察记录的形式供后续模型决策使用。该系统还引入了一个可复用的规则知识库,将反复出现的执行规则和验收标准转化为运行时知识。LemonHarness 进一步增加了时间感知执行机制,向模型暴露已用和剩余预算,使其能够在时间压力变化时重新平衡探索、实现和验证工作,避免因长时间等待或过度验证而超时。在 Terminal-Bench 2.0 上,LemonHarness_GPT-5.3-CodeX 在 445 次试验中达到了 84.49% 的准确率;将同一框架与更强的 GPT-5.5 后端配对,在五个作业中平均准确率提升至 86.52%。结果表明,统一的运行时边界、可调用的规则知识以及时间感知执行能够提升长周期智能体执行的稳定性。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:46

# LemonHarness技术报告
来源:https://arxiv.org/html/2606.24311
Kailong Ren¹,∗, Fubo Sun¹,∗, Jiachen Liu¹, Liu Yang¹, Zimo Yin¹, Jiaying Li¹, Congli Yin¹, Ming He¹,†, Yu Huo¹, Jiawei Liu¹, Zeping Chen¹, Yubin Huangfu¹, Ronghua Li¹, Yixuan Wu¹, Xing Su¹, Yanzhi Xu¹, Likang Wu², Hongke Zhao², Lei Zhang³, Xiaohui Geng⁴, Jianping Fan¹ ¹联想CTO组织AI实验室 ²天津大学 ³安徽大学 ⁴清华大学心理与认知科学系

###### 摘要

随着大语言模型(LLM)智能体被应用于更长期的任务,它们越来越多地在多轮迭代中修改工作空间状态。然而,智能体通常只能观察到工具输出和日志片段,而实际的状态变化发生在文件系统中。如果没有明确的工作空间边界,诸如文件写入和临时工件生成等改变状态的操作可能会将更改分散到各个路径。随着时间的推移,这些约束薄弱的更改会累积,使得修改后的文件等状态难以追踪。本文提出了LemonHarness,一个面向长周期智能体的集成执行框架。LemonHarness通过将改变状态的操作限制在明确定义的工作空间内,并将模型调用、工具执行和规则知识纳入同一个受控边界,从而建立明确的执行边界。文件写入、依赖安装和临时工件创建等改变状态的操作通过结构化工具接口执行,执行反馈记录为观察结果,供后续模型决策使用。该系统还引入了可复用的规则知识库,将重复出现的执行规则和验收标准转化为运行时知识。LemonHarness进一步增加了时间感知执行机制,向模型暴露已消耗时间和剩余预算,使其能够在时间压力变化时重新平衡探索、实现和验证工作的投入,避免因长时间等待或过度验证而超时。在Terminal-Bench 2.0上,LemonHarness\_GPT-5.3-CodeX在445次试验中达到了84.49%的准确率;将同一框架与更强的GPT-5.5骨干模型配对,在五个任务上平均准确率提升至86.52%。结果表明,统一的运行时边界、可调用的规则知识和时间感知执行能够提高长周期智能体执行的稳定性。

††footnotetext:∗均等贡献。†通讯作者。邮箱:[email protected]

## 1 引言

LLM智能体越来越多地被用于更长期、更具状态性且更接近真实执行环境的任务[2 (https://arxiv.org/html/2606.24311#bib.bib2),6 (https://arxiv.org/html/2606.24311#bib.bib6),14 (https://arxiv.org/html/2606.24311#bib.bib14),5 (https://arxiv.org/html/2606.24311#bib.bib5)]。在这些任务中,模型可能需要调用工具、编辑文件、安装依赖、创建临时工件、启动外部进程,并根据中间结果修正后续行动。因此,关键挑战不仅在于每个推理步骤是否正确,还在于智能体在经过多次状态更改操作后,能否保持对工作空间的准确视图。在实践中,模型通常只能观察到工具输出、错误消息和日志片段,而实际的状态变化发生在Shell、文件系统、临时目录、依赖环境和外部进程中。如果没有清晰的工作空间边界和对改变状态操作明确约束,文件写入、依赖安装和临时目录创建可能会分散到不同的路径和进程中。随着执行链越来越长,这些约束薄弱的状态变化不断累积,使得模型难以确定哪些文件已被修改、哪些命令改变了环境、哪些验证结果仍然有效,从而导致状态漂移。

SABER[1 (https://arxiv.org/html/2606.24311#bib.bib1)]表明,长周期智能体中的失败并非均匀分布在所有步骤中。它们集中在少量改变状态的操作上,例如文件创建。这些操作仅占所有步骤的约14-18%,但一次错误的改变状态的偏离可使任务成功的概率降低57-82%,而类似的非改变状态的偏离仅使成功概率降低7-15%。其他研究也表明,长周期任务的成功不仅取决于单个行动,还取决于环境状态在多轮执行中是否保持一致[11 (https://arxiv.org/html/2606.24311#bib.bib11),16 (https://arxiv.org/html/2606.24311#bib.bib16)]。这些发现表明,长周期任务中的改变状态操作应在明确的工作空间约束下执行,以减轻状态漂移。

受此观察启发,LemonHarness使执行边界显式化。它将改变状态的操作限制在明确定义的工作空间内,并将模型调用、工具执行、结构化工具定义、任务知识、工作空间状态和执行日志组织在同一个受控框架内。文件写入、依赖安装、临时工件创建和验证命令等改变状态的操作通过结构化的工具接口在指定的工作空间内执行。它们的反馈被记录为观察结果供后续决策使用,从而使模型能够从连贯的工作空间状态继续执行,而不是从分散的日志中推断环境。这种设计使观察、执行、修改和验证围绕相同的任务上下文保持一致,降低了长运行任务中的状态漂移风险。

先前研究表明,可复用的经验知识能够有效提高模型性能和执行稳定性[12 (https://arxiv.org/html/2606.24311#bib.bib12),17 (https://arxiv.org/html/2606.24311#bib.bib17),19 (https://arxiv.org/html/2606.24311#bib.bib19)]。LemonHarness进一步引入通用过程知识,将可跨任务迁移的执行启发式和验证标准转化为运行时先验。许多任务共享可复用的执行模式。例如,在深度学习任务中,仅凭损失下降并不一定表明任务完成;还必须考虑数据拆分、随机种子和验证指标等通用约束。如果这些约束未被纳入运行时知识,模型可能会产生看似合理但在实践中无效的解决方案。通用过程知识提前暴露了这些任务边界,给智能体提供早期方向感,从而实现更稳定的任务执行。

长周期任务不仅受正确性要求的约束,还受严格的执行预算限制[4 (https://arxiv.org/html/2606.24311#bib.bib4),9 (https://arxiv.org/html/2606.24311#bib.bib9)]。在终端环境中,智能体可能在开放式探索上花费过多时间,等待长时间运行的命令,或者即使已经产生可接受的解决方案,仍反复验证中间结果。这种行为可能将原本可解决的任务变成超时失败。为解决这个问题,LemonHarness引入了时间感知执行机制。在开始执行前,LemonHarness将任务分配到一个时间层级,然后在执行过程中将已消耗时间和剩余时间反馈给模型。借助这一信号,模型可以在截止日期临近时调整探索、实现和验证之间的精力分配,而不是在长时间运行的命令上停滞或在后期堆叠冗余的检查。

在Terminal-Bench 2.0[7 (https://arxiv.org/html/2606.24311#bib.bib7)]上,LemonHarness\_GPT-5.3-CodeX在445次试验中达到了84.5%的准确率。在使用GPT-5.5[13 (https://arxiv.org/html/2606.24311#bib.bib13)]的额外验证中,LemonHarness在五个任务上平均准确率达到86.52%,总共解决了445次试验中的385次。这些结果表明,统一的运行时边界、可复用的通用规则知识和时间感知执行的组合,能够在真实的长周期任务中实现强劲性能。

主要贡献如下:

- •LemonHarness设计了一个集成执行框架,将提示词、工具执行器、技能、执行日志和模型调用管理在同一处,使观察、执行、修改和验证保持在相同的运行时边界内。
- •LemonHarness引入了可复用的通用规则知识,将重复出现的执行规则和验收标准转化为运行时先验,在任务早期引导模型。
- •LemonHarness增加了时间感知执行机制,使模型能够根据已消耗和剩余时间调整探索、实现和验证。
- •LemonHarness在Terminal-Bench 2.0上进行了评估,其中LemonHarness\_GPT-5.3-CodeX在445次试验中达到了84.5%的准确率,并且使用GPT-5.5的额外验证在五个任务上平均准确率达到86.52%。

## 2 相关工作

### 2.1 集成式LLM智能体框架

近期工作探索了如何在统一的智能体框架中集成推理、行动和工具使用[8 (https://arxiv.org/html/2606.24311#bib.bib8),5 (https://arxiv.org/html/2606.24311#bib.bib5),18 (https://arxiv.org/html/2606.24311#bib.bib18)]。ReAct[20 (https://arxiv.org/html/2606.24311#bib.bib20)]将思维链推理与工具调用交错,展示了推理轨迹可以在单一执行循环中指导行动选择。Toolformer[10 (https://arxiv.org/html/2606.24311#bib.bib10)]通过将工具调用插入训练数据,使语言模型能够自我监督API使用,提供了结构化外部交互的机制。PAL[3 (https://arxiv.org/html/2606.24311#bib.bib3)]将自然语言推理与程序执行分离,将计算委托给外部解释器,强调模块化执行。Voyager[15 (https://arxiv.org/html/2606.24311#bib.bib15)]进一步引入了终身技能库,随着时间的推移积累可执行程序,形成持久的行动空间。虽然这些方法将模型与工具或执行环境连接起来,但它们通常将提示词、执行日志和运行时控制视为松散耦合的组件。相比之下,LemonHarness将提示词、工具执行器、技能管理、执行轨迹和模型调用统一在单个运行时边界内,使得在统一的执行框架下实现一致的观察、修改和验证。

### 2.2 可复用知识与时间感知控制

近期一些智能体系统复用来自先前经验或发现的行动模式的知识。ExpeL从过去的轨迹中提取自然语言洞察,而WebXSkill将重复出现的网页行动子序列转换为可复用的技能[21 (https://arxiv.org/html/2606.24311#bib.bib21),17 (https://arxiv.org/html/2606.24311#bib.bib17)]。LemonHarness遵循这一方向,但专注于通用执行规则。它将重复出现的约束、评估器要求和验收标准转化为运行时先验,使智能体能够在详细探索之前以更清晰的边界开始任务。

除了知识复用,长周期智能体还面临第二个正交挑战:时间管理。长周期智能体必须决定在探索、实现和验证上投入多少精力。先前关于动态规划的工作表明,在长周期设置中,在每个行动前进行规划可能会引入不必要的测试时成本[9 (https://arxiv.org/html/2606.24311#bib.bib9)]。LemonHarness通过时间感知执行使这种权衡显式化:已消耗和剩余的时间被视为运行时状态,允许智能体随着截止日期的临近从广泛探索转向结果保留和针对性验证。

## 3 方法

### 3.1 总体架构

LemonHarness为长周期任务构建了一个分层执行框架。系统围绕任务接收、模型决策、工具执行、知识支持和日志记录进行组织。当任务进入系统时,运行时首先创建一个受控的工作空间,并加载系统提示词、工具定义和可泛化的规则知识。然后,模型根据当前任务状态产生一个行动意图;该意图被转化为结构化的工具调用,在受控工作空间内执行,并返回反馈供后续决策使用。图1 (https://arxiv.org/html/2606.24311#S3.F1)给出了此执行框架的概览。

图1:LemonHarness框架概览。任务通过一个统一的运行时边界进行处理,该边界集成了模型推理、工具执行、工作空间状态和执行日志。通用规则知识提供可复用的执行规则、标准和任务先验,而时间感知控制根据已消耗和剩余预算调整探索、实现和验证。最终任务状态通过外部验证检查,同时保留可追溯的执行记录。

通过将这些步骤安排在相同的执行边界内,LemonHarness使模型判断、工具行动和环境状态围绕共享的任务上下文保持一致。时间感知机制将剩余预算反馈给模型,使其能够根据剩余时间调整检查、构建和验证的节奏,而不是在长时间运行的命令上停滞或在截止日期附近积累冗余的检查。

这些设计选择使智能体能够在长执行链中保持环境状态和时间压力同步,同时可泛化的规则知识帮助其尽早建立可行的方向。它们共同使任务执行更加稳定。

### 3.2 集成执行框架

LemonHarness的核心方法是将智能体执行的主要组件纳入同一个框架。系统提示词、工具执行器、技能库、执行日志和模型控制循环被集中管理,而不是作为围绕模型的独立部分。这种设计使智能体的观察、行动、修改和验证步骤处于相同的运行时约束集下。

对于长周期任务,这种集成边界至关重要,因为模型对任务的信念容易偏离实际的环境状态。文件可能已被修改,依赖可能已安装,或者命令可能以影响后续决策的方式改变了工作空间。通过将模型控制、工具执行、任务知识和日志保持在相同的框架内,LemonHarness减少了这种脱节,并使执行过程更易于追踪和纠正。

### 3.3 可复用的规则知识

LemonHarness将可复用的执行规则和验收标准组织为运行时知识,这样模型不必从空白状态开始每个任务。这些知识捕获了跨任务族重复出现的模式,包括输入输出约定、评估器约束、环境限制和常见失败模式。它使智能体在开始详细探索之前,对有效解决方案应具备的特征有一个早期认识。可泛化的规则知识的作用是提前暴露这些边界,从而减少盲目试错,并使智能体的早期行动与评估者最终将应用的验收条件相一致。

表1 (https://arxiv.org/html/2606.24311#S3.T1)总结了LemonHarness中可复用的规则知识的当前覆盖范围。在这些领域中,知识库捕获了重复出现的输入输出契约、环境假设和验证顺序。

表1:LemonHarness中可复用的规则知识的覆盖范围。每个领域都有可复用的规则支持,这些规则捕获

相似文章

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

审计智能体执行框架安全性

arXiv cs.CL

本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。