@qizhengz_alex: 非常感谢您推荐我们的工作,ACE(Agentic Context Engineering)和 Meta-Harness!@lilianweng 我打赌:harness …

X AI KOLs Timeline 论文

摘要

ACE (Agentic Context Engineering) 引入了一个框架,将上下文视为不断演化的剧本,防止上下文崩溃,并提高在智能体和特定领域基准测试上的性能。该工作强调了 harness engineering 作为模型训练数据引擎的潜力。

非常感谢您推荐我们的工作,ACE(Agentic Context Engineering)和 Meta-Harness!@lilianweng 我打赌:harness engineering 不仅是一种测试时技术——它产生的痕迹也可以作为模型预训练/中期训练的数据引擎。我很快就会写一些关于这个的内容 : ) 论文链接 ACE: https://arxiv.org/abs/2510.04618 Meta-Harness: https://arxiv.org/abs/2603.28052
查看原文
查看缓存全文

缓存时间: 2026/07/07 23:39

非常感谢你们展示我们的工作,ACE(智能体化上下文工程)和 Meta-Harness! @lilianweng

我的预测:Harness 工程不仅是一种测试时技术——它生成的轨迹还可以作为模型预训练/中间训练的数据引擎。我很快会写一篇文章详述这一点。

论文链接
ACE: https://arxiv.org/abs/2510.04618
Meta-Harness: https://arxiv.org/abs/2603.28052


智能体化上下文工程:为自改进语言模型进化上下文

来源:https://arxiv.org/html/2510.04618 Qizheng Zhang1∗, Changran Hu2∗, Shubhangi Upasani2, Boyuan Ma2, Fenglu Hong2, Vamsidhar Kamanuru2, Jay Rainton2, Chen Wu2, Mengmeng Ji2, Hanchen Li3, Urmish Thakker2, James Zou1, Kunle Olukotun1 1Stanford University2SambaNova Systems, Inc.3UC Berkeley {qizhengz (https://arxiv.org/html/2510.04618v3/mailto:[email protected]),kunle (https://arxiv.org/html/2510.04618v3/mailto:[email protected])}@[email protected] (https://arxiv.org/html/2510.04618v3/mailto:[email protected]) ace-agent/ace (https://github.com/ace-agent/ace)ace-agent.github.io (https://ace-agent.github.io/)∗共同第一作者

摘要

大型语言模型(LLM)应用,如智能体和领域特定推理,日益依赖上下文适应:通过指令、策略或证据修改输入,而非更新权重。先前的方法提高了可用性,但常受限于简洁性偏差(即为了简洁摘要而丢失领域洞见)和上下文坍缩(即迭代重写随时间推移侵蚀细节)。我们提出 ACE(智能体化上下文工程),这是一个将上下文视为不断进化的策略手册的框架,通过生成、反思和整理的结构化流程积累、完善和组织策略。ACE 通过结构化、增量式更新防止坍缩,保留详细知识,并随着长上下文模型的扩展而扩展。在智能体和领域特定基准测试上,ACE 在离线(如系统提示词)和在线(如智能体记忆)场景中均能优化上下文,持续超越强基线:智能体任务提升 10.6%,金融任务提升 8.6%,同时显著降低适应延迟和部署成本。值得注意的是,ACE 无需标注监督即可有效适应,仅利用自然的执行反馈。在 AppWorld 排行榜上,ACE 在总体平均分上持平排名最高的生产级智能体,并在更难的测试挑战子集上超越它,尽管使用的是较小的开源模型。这些结果表明,全面、不断进化的上下文能够以低开销实现可扩展、高效且自改进的 LLM 系统。

1. 引言

参考图注:图 1:整体性能结果。我们提出的 ACE 框架在智能体和领域特定任务上持续优于强基线。

基于大型语言模型(LLM)的现代 AI 应用,如 LLM 智能体 (yao2023react; yang2024swe) 和复合型 AI 系统 (zaharia2024compoundGS),日益依赖上下文适应。与修改模型权重不同,上下文适应通过将清晰的指令、结构化的推理步骤或领域特定的输入格式直接纳入模型输入,在模型训练后提升性能。上下文支撑着许多 AI 系统组件,包括指导下游任务的系统提示词 (opsahl2024optimizing; agrawal2025gepa)、承载过往事实和经验的记忆 (suzgun2025dynamic; xu2025mem),以及减少幻觉、补充知识的事实证据 (asai2024self)。

通过上下文而非权重进行适应具有若干关键优势。上下文对用户和开发者是可解释和可说明的 (wei2022chain; wang2022self),允许在运行时快速整合新知识 (lewis2020retrieval; borgeaud2022improving),并且可以在复合系统中的不同模型或模块之间共享 (khot2022decomposed)。与此同时,长上下文 LLM (peng2023yarn) 和上下文高效推理(如 KV 缓存复用)(gim2024prompt; yao2025cacheblend) 的进展,使得基于上下文的方法在部署上越来越实用。因此,上下文适应正成为构建能力强大、可扩展且自改进的 AI 系统的核心范式。

尽管取得了这些进展,现有的上下文适应方法仍面临两个限制。首先,简洁性偏差:许多提示词优化器优先考虑简洁的适用指令,而非全面的积累。例如,GEPA (agrawal2025gepa) 将简洁性视为优势,但这种抽象可能会遗漏领域特定的启发式方法、工具使用指南或实践中重要的常见失败模式 (gao2025prompt)。这一目标与某些场景下的验证指标相符,但往往无法捕捉到智能体和知识密集型应用所需的详细策略。其次,上下文坍缩:依赖 LLM 进行整体式重写的方法往往会随时间退化得更短、信息量更少的摘要,导致性能急剧下降(图2 (https://arxiv.org/html/2510.04618#S2.F2))。在诸如交互式智能体 (trivedi2024appworld; patil2024gorilla; zhang2024caravan)、领域特定编程 (ye2023generating; zhang2025adaptive; zhang2025accelopt; mang2025frontiercs) 以及金融或法律分析 (loukas2022finer; guha2023legalbench; wang2025finlora) 等领域,强性能依赖于保留详细的任务特定知识,而非将其压缩掉。

随着智能体和知识密集推理等应用对可靠性的要求越来越高,最近的工作已转向用丰富、可能有益的信息饱和上下文 (jiang2025putting; chung2025long; chen2025flora),这得益于长上下文 LLM (peng2023yarn; mao2024lift) 的进步。**我们认为,上下文不应作为简洁摘要,而应作为全面、结构化的策略手册,要求详细、包容且富含领域洞见。**与通常受益于简洁概括的人类不同,LLM 在提供长而详细的上下文时更有效,并能自主提炼相关性 (jiang2025putting; liu2025selfelicit; suzgun2025dynamic)。因此,上下文不应压缩掉领域特定的启发式方法和策略,而应保留它们,让模型在推理时自行决定哪些重要。

为了解决这些限制,我们引入 ACE(智能体化上下文工程),这是一个在离线场景(如系统提示词优化)和在线场景(如测试时记忆适应)中用于全面上下文适应的框架。ACE 不是将上下文压缩成提炼后的摘要,而是将其视为不断进化的策略手册,随时间积累和组织策略。通过设计,ACE 整合了生成、反思和整理的结构化工作流,同时通过“增长与提炼”原则引导结构化、增量式的更新。这种设计保留了详细的领域特定知识,防止了上下文坍缩,并生成了在整个适应过程中保持全面性和可扩展性的上下文。

我们在两个最受益于全面、进化式上下文的 LLM 应用类别上评估 ACE:(1) 智能体 (trivedi2024appworld),需要多轮推理、工具使用和环境交互,积累的策略可在各轮剧之间复用;(2) 领域特定基准测试,需要专门的策略和知识,如金融分析 (loukas2022finer; wang2025finlora)。我们的主要发现是:

  • ∙\bulletACE 在智能体任务上平均提升 10.6%,在领域特定基准测试上平均提升 8.6%,在离线和在线适应场景中均持续超越强基线。
  • ∙\bulletACE 能够在没有标注监督的情况下构建有效上下文,而是利用执行反馈和环境信号,这是实现自改进 LLM 和智能体的关键要素。
  • ∙\bullet在 AppWorld 基准测试排行榜 (AppWorldLeaderboard) 上,ACE 超越了排名第一的生产级智能体 IBM-CUGA (marreed2025towards)(由 GPT-4.1 驱动),同时使用了开源模型(DeepSeek-V3.1)。
  • ∙\bulletACE 所需的部署轮次显著更少,适应延迟更低,表明可扩展的自改进可以同时实现更高的准确率和更低的成本。

2. 背景与动机

2.1 上下文适应

上下文适应(或上下文工程)指的是通过构建或修改 LLM 的输入来改善模型行为的方法,而非改变其权重。当前最先进的方法利用自然语言反馈 (shinn2023reflexion; yuksekgonul2024textgrad; agrawal2025gepa)。在这种范式下,语言模型检查当前上下文以及执行轨迹、推理步骤或验证结果等信号,并生成关于如何修改上下文的自然语言反馈。然后,该反馈被整合到上下文中,实现迭代适应。代表性方法包括 Reflexion (shinn2023reflexion),它通过反思失败来改进智能体规划;TextGrad (yuksekgonul2024textgrad),通过类似梯度的文本反馈优化提示词;GEPA (agrawal2025gepa),基于执行轨迹迭代改进提示词,在某些场景下甚至超越了强化学习方法;以及 Dynamic Cheatsheet (krause2019dynamic),它构建一个外部记忆,在推理过程中积累来自过去成功和失败的经验教训。这些自然语言反馈方法代表了重大进步,为在权重更新之外改进 LLM 系统提供了灵活且可解释的信号。

2.2 现有上下文适应方法的局限性

简洁性偏差

上下文适应方法的一个反复出现的局限性是简洁性偏差:优化倾向于坍缩为短而通用的提示词。Gao 等人 (gao2025prompt) 在测试生成的提示词优化中记录了这一效应,迭代方法反复产生几乎相同的指令(例如,“创建单元测试以确保方法按预期行为”),牺牲了多样性并遗漏了领域特定细节。这种收敛不仅缩小了搜索空间,而且由于优化后的提示词常继承其初始版本的相同缺陷,还会在迭代中传播重复错误。更广泛地说,这种偏差在需要详细、上下文丰富指导的领域(如多步智能体、程序合成或知识密集型推理)中损害了性能,因为这些领域的成功取决于积累而非压缩任务特定的洞见。

参考图注:图 2:上下文坍缩。LLM 对上下文的整体式重写可能将其压缩为更短、信息更少的摘要,导致性能急剧下降。

上下文坍缩

在 AppWorld 基准测试 (trivedi2024appworld) 的一个案例研究中,我们观察到一种称为上下文坍缩的现象,该现象发生在 LLM 在每次适应步骤中被要求完全重写累积的上下文时。随着上下文变得庞大,模型倾向于将其压缩成更短、信息更少的摘要,导致信息严重丢失。例如,在第 60 步时,上下文包含 18,282 个 token,准确率达到 66.7;但在下一步,它坍缩到仅 122 个 token,准确率降至 57.1——比未适应时的基线准确率 63.7 还要差。虽然我们通过 Dynamic Cheatsheet (suzgun2025dynamic) 突出显示了这一点,但该问题并非该方法独有;相反,它反映了使用 LLM 进行端到端上下文重写的根本风险,即累积的知识可能被突然擦除而非保留。

参考图注:图 3:ACE 在 AppWorld 基准测试上生成的上下文示例(部分显示)。ACE 生成的上下文包含详细的领域特定洞见以及易于使用的工具和代码,作为 LLM 应用的全面策略手册。

3. 智能体化上下文工程 (ACE)

我们提出 ACE(智能体化上下文工程),一个在离线(如系统提示词优化)和在线(如测试时记忆适应)场景中实现可扩展且高效上下文适应的框架。与将知识压缩成简洁摘要或静态指令不同,ACE 将上下文视为不断进化的策略手册,持续积累、完善和组织策略。受 Dynamic Cheatsheet (suzgun2025dynamic) 的智能体化设计启发,ACE 引入了三个角色之间的结构化分工(图4 (https://arxiv.org/html/2510.04618#S3.F4)):生成器,产生推理轨迹;反思器,从成功和错误中提炼具体洞见;整理器,将这些洞见整合成结构化的上下文更新。这模仿了人类学习的方式:实验、反思和巩固,同时避免了将所有责任加载到单一模型上的瓶颈。

参考图注:图 4:ACE 框架。受 Dynamic Cheatsheet 启发,ACE 采用智能体化架构,包含三个专门组件:生成器、反思器和整理器。

为了解决先前方法在 §2.2 (https://arxiv.org/html/2510.04618#S2.SS2) 中讨论的局限性(尤其是简洁性偏差上下文坍缩),ACE 引入了三个关键创新点:(1) 一个专用的反思器,将评估和洞见提取与整理分离,提高了上下文质量和下游性能 (§4.6 (https://arxiv.org/html/2510.04618#S4.SS6));(2) 增量式增量更新 (§3.1 (https://arxiv.org/html/2510.04618#S3.SS1)),用局部编辑取代昂贵的大规模重写,降低了延迟和计算成本 (§4.7 (https://arxiv.org/html/2510.04618#S4.SS7));(3) 增长与提炼机制 (§3.2 (https://arxiv.org/html/2510.04618#S3.SS2)),平衡稳定的上下文扩展与冗余控制。

如图4 (https://arxiv.org/html/2510.04618#S3.F4) 所示,工作流始于生成器为新查询产生推理轨迹,这既揭示了有效策略也揭示了重复出现的陷阱。反思器批评这些轨迹以提取经验教训,并可选择跨多次迭代进行完善。然后,整理器将这些经验教训综合成紧凑的增量条目,这些条目通过轻量级、非 LLM 的逻辑确定性合并到现有上下文中。由于更新是条目化和局部化的,多个增量条目可以并行合并,从而实现大规模的批量适应。ACE 进一步支持多轮适应,其中相同的查询被重新访问,以逐步加强上下文。

3.1 增量式增量更新

ACE 的一个核心设计原则是将上下文表示为一系列结构化、条目化的要点,而非单一的庞大提示词。要点的概念类似于 LLM 记忆框架(如 Dynamic Cheatsheet (suzgun2025dynamic) 和 A-MEM (xu2025mem))中的记忆条目,但在此基础上进行了扩展。要点包括 (1) 元数据,包含唯一标识符和统计该条目被认为有用或有害的计数器;以及 (2) 内容,捕获一个小单元,如可复用的策略、领域概念或常见的失败模式。在解决新问题时,生成器标记哪些要点是有用或误导的,提供反馈以指导反思器提出修正更新。

这种条目化设计实现了三个特性:(1) 局部化,因此仅更新相关的要点;(2) 细粒度检索,因此生成器可以专注于最相关的知识;

相似文章

@astaxie: 今天群里面讨论怎么样学习 Harness,Harness 工程我学习这两个: 1. https://github.com/walkinglabs/learn-harness-engineering… 通过这个了解每一个 Harness 的…

X AI KOLs Timeline

A project-based course repository on Harness Engineering for AI coding agents, covering environment setup, state management, verification, and control mechanisms to make AI coding agents work reliably. The course synthesizes best practices from OpenAI and Anthropic on building effective harnesses for long-running agents.

HarnessX:可组合、自适应且可演进的智能体夹具工坊

Hugging Face Daily Papers

HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。