ContextWeave:一个真实世界的工作流基准
摘要
ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。
arXiv:2608.04830v1 公告类型:新
摘要:随着语言智能体从孤立任务转向长时程、有状态的工作流,记忆变得至关重要,然而现有评估往往将其简化为检索或问答。我们引入了 ContextWeave,这是一个纵向基准,用于评估回忆的经验是否能够提升现实办公工作流中下游智能体的性能。ContextWeave 将 14 名参与者经过隐私保护的多月工作流重构为 1,005 个可执行任务,其中包括 568 个核心评估任务,并配有指令、容器化环境、轨迹和针对特定任务的评分标准。它衡量工作区质量以及与参与者特定偏好的对齐程度,并辅以相关性、连续性、可解决性以及对误导性回忆的鲁棒性等诊断。在固定模型下,跨越六个记忆组件,最强配置将工作区得分从 68.08 提升至 78.20,偏好得分从 41.50 提升至 70.60。在固定记忆组件下,回忆显著改善了所有五个测试基础模型的结果,尽管收益差异很大。我们的分析表明,可操作、经验丰富的记忆比紧凑摘要更能有效地支持工作流延续并减少冗余探索,但也可能更容易受到误导性回忆的影响。这些发现促使记忆系统不仅优化检索相关性,还优化执行过程中的可靠使用。
查看缓存全文
缓存时间: 2026/08/06 07:43
# ContextWeave:真实世界工作流基准
Source: https://arxiv.org/html/2608.04830
1]Fudan University 2]Shanghai Innovation Institute 3]ByteDance
Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu
[[[
###### 摘要
记忆对于语言智能体从孤立任务转向长周期、有状态的工作流至关重要,然而现有评估往往将其简化为检索或问答。我们引入了 ContextWeave,一个纵向基准,用于评估回忆到的经验能否提升智能体在真实办公工作流中的下游表现。ContextWeave 将 14 名参与者的隐私保护多个月工作流重建为 1,005 个可执行任务,其中包括 568 个核心评估任务,附带指令、容器化环境、轨迹和任务特定评分标准。它衡量工作区质量以及与参与者特定偏好的对齐程度,并辅以相关性、连续性、可解性和对误导性回忆的鲁棒性诊断。在固定模型下,六个记忆组件中,最强配置将工作区得分从 68.08 提升到 78.20,偏好得分从 41.50 提升到 70.60。在固定记忆组件的情况下,回忆在全部五个测试基础模型上都改善了两项结果,尽管增益差异显著。我们的分析表明,可操作、经验丰富的记忆比紧凑摘要更能支持工作流延续并减少冗余探索,但也可能更容易受到误导性回忆的影响。这些发现促使记忆系统不仅要优化检索相关性,还要优化执行过程中的可靠使用。
## 1 引言
记忆日益被视为语言智能体的核心能力,因为它们正从孤立的基于提示的问题求解转向长周期、有状态的工作流。早期工作主要关注自包含的数学推理和短格式代码生成任务[lewkowycz2022minerva,roziere2023codellama,azerbayev2024llemma,shao2024deepseekmath]。现代智能体越来越需要处理在较长轨迹上展开的复杂工作流[mialon2023gaia,zhou2024webarena,jimenez2024swebench]。这在当前模型的有界上下文窗口与长周期智能体工作流日益增长的需求之间造成了根本性紧张,使得记忆对于保留任务相关信息、跨会话复用累积经验以及通过重复交互进行改进变得至关重要。
构建有效的记忆系统需要能够忠实衡量记忆是否改善智能体行为的评估协议。现有评估捕捉了该问题的不同侧面。长上下文、面向检索和对话式记忆基准通常评估模型能否对长输入或多会话对话中嵌入的信息进行检索、总结或推理[hsieh2024ruler,bai2024longbench,maharana2024locomo,wu2025longmemeval]。虽然有用,但这些设置大多将记忆简化为基于上下文的问答。端到端智能体基准能够反映记忆组件在完整智能体系统中的贡献,但它们通常组织为独立任务实例,因此对跨情节记忆提供的证据有限。自我改进方法[shinn2023reflexion,zhao2024expel]通过在现有任务分布上重复试验或轮次来评估进化。然而,这种重复试验设置忽略了真实纵向使用中稀疏、隐式和用户特定的依赖关系。
为弥补这一空白,我们首先将记忆评估与学习联系起来。在神经科学中,学习和记忆是紧密耦合的过程:有机体从环境获得经验,将其保留,并用它来塑造未来的行为[okano2000learning,kandel2014molecular]。这一观点为智能体记忆提出了一个简单的操作性标准:一个有用的记忆系统应当在任务流推进过程中改善下游任务表现。受此标准启发,我们引入了 ContextWeave,一个用于在真实办公场景中评估记忆系统的纵向基准。该基准基于真实用户数月内收集的工作文档构建,并通过严格的去标识化、数据清洗和人工标注处理。每个基准实例包含一个有序的用户特定任务流,附带重构的指令、执行轨迹、中间产物和评估标准。在测试时,我们比较智能体在有无先前任务历史的情况下完成目标任务的表现,从而提供在真实跨会话工作流中记忆所带来提升的可控且可复现的度量。
我们的实验表明,有用的记忆更适合被理解为对工作流延续的支持,而非孤立的检索。没有回忆时,智能体往往生成表面上完整的输出,却无法保留潜在的工作区状态和用户特定的工作习惯;对每个测试的基础模型,访问先前的经验都能改善工作区得分和偏好得分。然而,仅靠相关性是不够的:在我们测试的配置中,更接近具体上下文经验的记忆提供了更可操作的证据,并且比紧凑摘要更有效地减少了重复探索,但也更容易因误导性回忆而引发错误。这些结果促使我们通过下游结果、行为效应和鲁棒性来共同评估记忆。
我们的贡献如下:
- •一个基于真实工作流的纵向基准。我们引入了 ContextWeave,其中包含来自 14 名参与者多个月工作流的 1,005 个可重建可执行任务,包括用于评估的 568 个主工作流任务。每个参与者特定的流都保留了受隐私保护的历史、时间依赖、可执行环境和任务级评估标准。
- •一个可执行且受控的评估协议。我们开发了一套流程,从原始工作日志中重建指令和缺失观测值,通过执行验证每个任务,并通过受控轨迹对齐防止执行漂移累积。该协议衡量下游工作区和偏好结果,同时诊断相关性、连续性、可解性和幻觉鲁棒性。
- •对智能体记忆的系统性实证研究。我们在受控的有无回忆设置下评估了六个记忆组件和五个基础模型。结果表明,记忆在所有测试模型上都改善了下游结果,而其收益和风险取决于所回忆经验的可操作性以及模型可靠应用这些经验的能力。
## 2 相关工作
记忆在语言模型和智能体研究中一直以不同的语境被研究,每种语境都意味着不同的评估目标。在长上下文建模中,记忆强调对扩展输入的信息访问;在智能体系统中,它通常指一个情节内的工作记忆或跨会话的情节记忆。因此,我们将现有记忆评估分为四大类并逐一讨论。
### 2.1 长历史问答
一条常见的研究线索通过“历史之上的查询”格式评估记忆:给模型一个长上下文或对话历史,并让其回答基于该记录的查询。RULER 将 NIAH 式评估扩展到合成长上下文上的检索、多跳追踪和聚合任务[hsieh2024ruler]。这种评估形式广泛用于长上下文建模[fang2025artificial,bai2024longbench]。LoCoMo 和 LongMemEval 等长期对话基准在多会话对话历史上实例化了类似格式,问题针对事实、事件、偏好、时间关系或更新的用户信息[maharana2024locomo,wu2025longmemeval]。这些基准捕捉了记忆的一个重要方面:关键信息能否从历史上下文中提取出来并在被询问时使用。然而,由于它们将评估简化为对给定记录上的查询进行回答,它们未能说明记忆是否能改善更复杂智能体任务的下游表现。
### 2.2 独立智能体任务
另一条研究线索通过端到端智能体任务研究记忆。GAIA、SWE-bench 和 DeepSWE 等基准要求智能体在较长轨迹上解决复杂问题,从而隐式测试它们在执行过程中维护、组织和运用任务状态的能力[mialon2023gaia,jimenez2024swebench,huang2026deepswe]。这些基准在现实智能体任务中提供了有用的工作记忆探针,尽管它们并非专门为记忆而设计。为了近似情节记忆,先前工作通常让智能体在 HotpotQA 和 ALFWorld 等任务上运行多次试验或轮次,并将端到端性能的变化作为经验复用的证据[yang2018hotpotqa,shridhar2021alfworld,shinn2023reflexion,zhou2025memento,zhou2026mementoskills]。这通过衡量累积经验如何影响智能体在任务执行中的行为,将记忆评估扩展到问答式界面之外。然而,真实的纵向使用涉及可能稀疏、隐式和用户特定的依赖关系,这使得重复试验评估能否捕捉真实工作流中的记忆有效性仍不清楚。
### 2.3 构造的多会话智能体任务
最近的基准开始在多会话智能体设置中评估记忆。MemoryArena 构建了具有显式相互依赖子任务的人工设计任务,其中智能体必须从早期会话中提炼经验,并在记忆-智能体-环境循环中利用这些经验指导后续行动[he2026memoryarena]。这一方向超越了孤立的回忆,通过下游智能体行为来评估记忆。然而,这些基准中的跨会话依赖是手工构造的,可能无法充分反映真实工作流中出现的稀疏和隐式依赖。
### 2.4 组件级记忆诊断
一些基准通过首先规定记忆系统应支持的功能能力,然后为每种能力设计针对性指标来评估记忆。例如,MemBench 在事实性和反思性记忆、参与和观察场景以及效果、效率和容量等指标上衡量 LLM 智能体的记忆[tan2025membench]。MemoryAgentBench 将记忆智能体分解为准确检索、测试时学习、长距离理解和选择性遗忘等能力[hu2025memoryagentbench]。MemoryBench 模拟用户反馈以研究 LLM 系统中的记忆和持续学习,涵盖陈述性记忆和程序性记忆需求[ai2025memorybench]。这些基准对于诊断系统能否正确存储、检索、更新、抽象或遗忘信息非常有用。这种组件级测量更适合被视为解释性信号,而非对下游智能体表现的直接估计:一个在检索或更新指标上表现良好的记忆系统,未必能帮助智能体在未来的工作流中有效选择和运用过去的经验。
### 2.5 LLM 智能体中的记忆组件
除了记忆评估,我们简要回顾 LLM 智能体中记忆组件的构建方式。现有系统在抽象、组织和更新过去经验的方式上有所不同。MemoryBank 通过持续更新和受艾宾浩斯启发的遗忘与强化机制维护长期用户记忆,使智能体能够随时间适应用户[zhong2024memorybank]。Mem0 从对话中动态提取、整合和检索重要信息,并有一个基于图的变体来捕获关系结构[mem02025]。LangMem 是一个软件框架,提供用于构建语义、情节和程序记忆的模块化工具,支持对话内和后台记忆更新[langmem2025]。A-MEM 将经验组织为受 Zettelkasten 启发的结构化笔记,并动态创建和更新记忆条目之间的链接[xu2025amem]。MemOS 将记忆视为可管理的系统资源,统一了纯文本、基于激活和参数级记忆的表示、调度和演化[li2025memos]。这些系统共同跨越了记忆抽象、组织和生命周期控制的设计空间:基于紧凑事实或摘要的存储有利于高效检索,链接笔记系统维护记忆之间的显式关系,操作系统式框架协调异构记忆表示。
## 3 设计原则
### 3.1 数学表述
在真实场景中,智能体通常与用户在一系列相关任务上交互,而不是独立地解决孤立任务。我们将这种交互形式化为顺序任务流:
D=\(T1,T2,...,Tn\),T1→T2→...→Tn,D=\(T\_\{1\},T\_\{2\},\\dots,T\_\{n\}\),\\quad T\_\{1\}\\rightarrow T\_\{2\}\\rightarrow\\dots\\rightarrow T\_\{n\},\(1\)
其中每个TiT\_\{i\}表示智能体遇到的单个任务,排序反映了任务之间的时间依赖。给定记忆组件MM,我们评估利用先前任务经验是否能改善智能体在后续任务上的表现。具体而言,对于每个目标任务TiT\_\{i\},我们首先评估没有先前经验访问权的智能体,其性能记为R\(Ti\)R\(T\_\{i\}\)。随后,在配备记忆组件MM的情况下,智能体首先处理历史任务轨迹:
{T1,T2,...,Ti−1},\\\{T\_\{1\},T\_\{2\},\\dots,T\_\{i\-1\}\},\(2\)
并获得在求解目标任务TiT\_\{i\}时提供的记忆表示。由此产生的性能记为RM\(Ti\)R\_\{M\}\(T\_\{i\}\)。记忆组件的贡献通过历史经验带来的性能增益来衡量:
ΔRM\(Ti\)=RM\(Ti\)−R\(Ti\)。\\Delta R\_\{M\}\(T\_\{i\}\)=R\_\{M\}\(T\_\{i\}\)\-R\(T\_\{i\}\)。\(3\)
正值的ΔRM\(Ti\)\\Delta R\_\{M\}\(T\_\{i\}\)表示记忆组件成功地使智能体能够利用先前的经验来改善未来的任务执行。
### 3.2 基准设计考虑
为确保基准忠实反映真实智能体场景中的记忆使用情况,我们考虑了四项设计原则。
##### 隐私保护的真实性。
真实的记忆评估需要真实的工作流历史,而非人工构造的交互。因此,我们从真实世界的协作工作流构建基准,并应用隐私保护处理去除敏感信息,同时维护原始任务的结构属性,包括时间顺序、实体一致性和任务依赖关系。第4.2节 (https://arxiv.org/html/2608.04830#S4.SS2) 将详细讨论此问题。
##### 可执行且可复现的环境。
记忆评估应超越被动信息检索,衡量智能体能否在任务执行中利用历史经验。因此,我们提供可执行环境,使智能体能够直接与任务上下文交互。同时,我们通过控制外部依赖并在必要时重构不可用资源来确保可复现性,从而在不同记忆系统之间实现一致的评估。
##### 受控的纵向评估。
虽然真实工作流自然会在过程中发生演变,我们相似文章
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
Weavable
Weavable 是一款新产品,旨在为 AI 智能体提供持久化的工作上下文。
构建解决上下文污染与持久化问题的解决方案
作者介绍了 Weavable,这是一个专为解决 AI Agent 工作流中上下文污染与持久化问题而构建的平台层。它会在将数据传递给 LLM 之前,预先对企业工具中的数据进行预处理。
SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话
SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。