超越上下文窗口:数据智能体的持久发现上下文

arXiv cs.AI 论文

摘要

本文介绍了持久发现上下文,这是一个为数据智能体设计的轻量级记忆层,用于存储先前的意图到对象的映射,以增强跨任务的检索质量,在结构化数据环境中展示了改进。

arXiv:2609.02129v1 Announce Type: new 摘要:数据智能体在规划或执行之前会反复执行一个发现步骤:识别与任务相关的数据对象。然而,成功的发现结果通常被丢弃而不是重复使用。我们引入持久发现上下文,这是一个轻量级记忆层,它存储先前的意图到对象的映射,并重复使用它们来增强未来的检索。在三个结构化数据环境中,持久发现上下文持续改善了仅基于元数据的检索质量,对自动生成的记忆仍然有效,并暴露了一个可重现的干扰故障模式。在词汇稀疏的领域,仅基于记忆的检索甚至可以超越基于元数据的检索。这些发现表明,发现结果构成了数据智能体的一种有用的可重用上下文形式。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:01

# 数据智能体的持久化发现上下文
来源:https://arxiv.org/html/2609.02129
## 超越上下文窗口:数据智能体的持久化发现上下文

Jalal Mahmud

###### 摘要

数据智能体在规划或执行前反复执行一个发现步骤:识别与任务相关的数据对象。然而,成功的发现结果通常被丢弃而非重用。我们引入**持久化发现上下文**,这是一个轻量级的记忆层,用于存储先前的意图到对象映射,并重用它们来增强未来的检索。在三个结构化数据环境中,持久化发现上下文在检索质量上始终优于仅基于元数据的搜索,即使使用自动生成的记忆也保持有效,并揭示了一个可复现的干扰失败模式。在词法稀疏的领域,仅基于记忆的检索甚至可以超越基于元数据的检索。这些发现表明,发现结果构成了一种对数据智能体有用的可重用上下文形式。

## 1 引言

智能体记忆系统存储对话(Packer 等,2023 (https://arxiv.org/html/2609.02129#bib.bib1))、观察(Park 等,2023 (https://arxiv.org/html/2609.02129#bib.bib4))、可执行技能(Wang 等,2024 (https://arxiv.org/html/2609.02129#bib.bib5))和可重用的工作流(Wang 等,2025 (https://arxiv.org/html/2609.02129#bib.bib6))。这些机制帮助智能体在不同任务和会话间保留信息。数据智能体面临着不同的挑战:在规划或执行前,它们必须确定哪些数据对象与任务相关。尽管许多任务需要相似的表和属性,但发现过程通常被视为单次任务的操作。相关对象被识别、使用一次,然后被丢弃,而不是被保留为可重用的上下文。这提出了一个简单的问题:*成功的发现结果是否应该跨任务持久化?*

我们将发现结果定义为任务意图与证明对完成该任务有用的数据对象之间的映射。现有的元数据目录和模式链接方法支持发现([18],2026 (https://arxiv.org/html/2609.02129#bib.bib18);Yu 等,2018 (https://arxiv.org/html/2609.02129#bib.bib17);Wang 等,2020 (https://arxiv.org/html/2609.02129#bib.bib16);Pourreza 和 Rafiei,2023 (https://arxiv.org/html/2609.02129#bib.bib15)),但并未跨任务保留成功的发现结果。

为了解决这一差距,我们引入**持久化发现上下文**,这是一个轻量级的记忆层,用于存储先前的意图到对象映射,并重用它们来增强未来的检索。我们在三个真实世界的结构化数据环境中,使用125个保留任务对该方法进行了评估。我们的发现有四点。首先,在所有三个领域中,持久化发现上下文在检索质量上始终优于仅基于元数据的检索。其次,当使用LLM生成的记忆初始化时,该方法仍然有效,表明尽管记忆构建不完美,仍能获得有用的改进。第三,我们识别出一个可复现的干扰失败模式,其中语义相关但不正确的记忆会降低检索质量。我们额外观察到,在词法稀疏的领域,仅基于记忆的检索可以优于基于元数据的检索,表明积累的发现经验有时可以提供比对象描述本身更强的信号。

## 2 持久化发现上下文

我们假设存在一个数据对象(表和属性)注册表,其元数据以自然语言增强。注册表搜索使用基于此元数据的标准文本来检索候选对象。

**发现记忆。** 一个发现记忆 `m = ⟨intent, objects⟩` 记录了一个自然语言任务描述与一组被证明相关的数据对象之间的先前映射。发现记忆在注册表级别持久化,并在同一数据环境内跨任务累积。记忆从先前的发现结果创建,并在相关任务间重用。

**记忆增强检索。** 给定查询 `q`,注册表检索为每个候选对象 `o_i` 生成一个相关性分数 `r(q, o_i)`。然后我们检索最相似的发现记忆,并使用它们来增强对象排序。

`score(q, o_i) = r(q, o_i) + α ∑_{m ∈ top-K_m} sim(q, m.intent) · 1[o_i ∈ m.objects]` (1)

其中 `α` 控制记忆的影响,`1[o_i ∈ m.objects]` 指示对象 `o_i` 是否出现在检索到的记忆中。设置 `α = 0` 恢复标准的注册表搜索。设置 `r(q, o_i) = 0` 则产生一个仅基于记忆的排序器(S2)。

## 3 实验

### 数据集和任务

我们在三个结构上不同的领域的三个真实世界的结构化数据环境中进行评估。

**金融。** 捷克PKDD'99银行数据集(Berka 和 Bruha,1999 (https://arxiv.org/html/2609.02129#bib.bib7)):6个表,42个属性,涵盖客户账户、交易和贷款。

**NYC碰撞。** NYPD机动车辆碰撞数据(纽约市开放数据,2025 (https://arxiv.org/html/2609.02129#bib.bib2)):3个表,41个属性,涵盖碰撞、车辆和人员级别的记录。

**Northwind。** 微软Northwind贸易商(微软,2025 (https://arxiv.org/html/2609.02129#bib.bib3)):8个表,43个属性,涵盖客户、订单、产品、员工、供应商和类别。

对于每个领域,我们构建一个注册表,其自然语言描述是根据模式名称、关系和数据集文档手动编写的。相同的描述在所有检索条件下使用。我们将任务组织为15个任务族(每个领域5个)。每个族将共享相同相关数据对象但表面词汇不同的查询分组,这些查询基于领域知识在主题上定义(例如,`transaction_behavior`、`loan_risk`、`injury_severity`)。每个族包含一个用于初始化发现记忆的种子任务和一组保留的评估任务,每个族5到12个任务。为了估计对种子选择的敏感性,我们还执行了一个留一法(LOO)轮换,其中族中的每个任务依次作为种子;结果报告在附录G (https://arxiv.org/html/2609.02129#A7)中。在所有领域中,基准测试包含140个任务,由125个保留的评估任务和15个种子任务组成。我们还构建了三个干扰任务,仅用于表2 (https://arxiv.org/html/2609.02129#S3.T2)中的分析。每个任务都手工标注了3-5个相关数据对象。

### 实验条件

我们比较四种检索设置:

- • **S0:原始元数据。** 仅搜索对象名称。
- • **S1:注册表。** 搜索对象名称和描述。
- • **S2:记忆。** 仅使用发现记忆对对象进行排序,不进行注册表检索(即,公式1 (https://arxiv.org/html/2609.02129#S2.E1)中的 `r(q, o_i) = 0`)。
- • **S3:注册表+记忆。** S1用发现记忆增强(公式1 (https://arxiv.org/html/2609.02129#S2.E1))。

除非另有说明,S0-S3使用TF-IDF检索。记忆相似度使用与注册表检索器相同的检索模型。我们设置 `K_m = 5`;由于每个领域有5个任务族,每个族有一个种子记忆,这会按相似度加权检索所有存储的记忆。为了评估检索器的独立性,我们还评估了基于`all-MiniLM-L6-v2`句子嵌入(Reimers 和 Gurevych,2019 (https://arxiv.org/html/2609.02129#bib.bib8))的神经检索器上的S1、S2和S3;这些条件标记为S1⋆、S2⋆和S3⋆。我们还评估了所有条件(S0-S3)使用BM25作为替代的词汇检索器,并与一个朴素注入变体(S4)进行比较;两者都报告在附录H (https://arxiv.org/html/2609.02129#A8)和附录F (https://arxiv.org/html/2609.02129#A6)中。为了测试对不完美记忆的鲁棒性,我们用Claude Haiku自动生成的映射替换了用于初始化发现记忆的手工标注的意图到对象映射(附录C (https://arxiv.org/html/2609.02129#A3))。

**表1:** 在保留评估任务上的F1@5。无星号:TF-IDF;⋆:神经网络(`all-MiniLM-L6-v2`)。记忆条件使用 `α = 0.5`。完整指标见附录B (https://arxiv.org/html/2609.02129#A2);LOO鲁棒性见附录G (https://arxiv.org/html/2609.02129#A7)。

### 主要结果

表1 (https://arxiv.org/html/2609.02129#S3.T1)总结了结果。

**持久化发现上下文改进了检索。** 添加发现记忆(S3)在所有三个领域使用TF-IDF检索时都提高了F1@5:金融 `0.396 → 0.499`(`+0.103`),NYC碰撞 `0.299 → 0.482`(`+0.183`),Northwind `0.446 → 0.528`(`+0.082`)。附录I (https://arxiv.org/html/2609.02129#A9)展示了其对智能体规划质量的下游影响。最大的增益出现在NYC碰撞中(从S1到S3 `+0.183` vs. 从S0到S1 `+0.072`),表明记忆补偿了仅元数据描述无法解决的词汇不匹配。

使用神经检索时,记忆在金融中提高了F1@5 `+0.167`,在Northwind中提高了`+0.119`,在NYC碰撞中提高了`+0.051`,其中神经基础检索器已经很强(S1⋆ MRR=0.848;附录B (https://arxiv.org/html/2609.02129#A2))。NYC中较小的增益与神经检索器已经解决了发现记忆在TF-IDF设置中补偿的许多词汇不透明性相一致。这种模式通过记忆权重消融研究得到证实(附录E (https://arxiv.org/html/2609.02129#A5)),该研究表明当基础检索器留给记忆贡献的空间较小时,较低的 `α` 值表现更好。

**在词法稀疏的领域,仅记忆就具有信息量。** 在TF-IDF检索下,S2(仅记忆)在NYC碰撞中超过了S1(注册表)(`0.412` vs. `0.299`),表明当属性名称是复合且词法不透明时(例如,`contributing_factor_vehicle_1`),仅记忆信号就优于元数据搜索。在金融和Northwind的TF-IDF下,S1仍然强于S2,因此需要结合两者(S3)才能从记忆中受益。在神经检索下,这种模式部分反转:S2⋆在金融(`0.533` vs. `0.427`)和Northwind(`0.494` vs. `0.480`)中优于S1⋆,而S1⋆在NYC碰撞中仍然更强(`0.435` vs. `0.418`)。

**记忆增益在不同任务族中并不均匀。** 具有独特对象词汇表的族(例如,时间分析或交易行为)从发现记忆中获益最大,而对象在多种任务类型中重复出现的族则表现出接近零或负的增益(附录D (https://arxiv.org/html/2609.02129#A4))。

**LLM生成的记忆仍然有用。** 自动生成的记忆在对象级一致性(F1)上分别达到0.698、0.762和0.735(金融、NYC、Northwind),与手工标注的发现记忆相比。检索在两个领域中仍然优于S1(金融:F1@5=0.433 vs. 0.396;NYC:0.452 vs. 0.299),并且在所有三个领域中都高于S0,表明对不完美记忆构建具有鲁棒性(详见附录C (https://arxiv.org/html/2609.02129#A3))。

### 负面结果:跨族干扰

表2 (https://arxiv.org/html/2609.02129#S3.T2)在所有三个领域中展示了一个一致的失败模式。当一个语义相似但不正确的发现记忆被激活时,检索质量会下降到无记忆基线以下。例如,在金融中,术语*withdrawal*可能在任务实际涉及贷款分析时激活交易行为记忆。在NYC碰撞中,*vehicle type*可能在任务涉及伤害分析时激活车辆档案记忆。Northwind中也发生类似效应,订单相关词汇出现在多个任务族中。这些结果表明,发现记忆并非普遍有益。表层词汇重叠可能会在适当的任务族尚未被观察到时激活不正确的记忆并扭曲排序。这种失败模式促使未来工作研究记忆选择、置信度估计和干扰感知检索。

**表2:** 跨族干扰。每个任务在S1(无记忆)、S3(用错误族记忆初始化)和S3(用正确族记忆初始化)下进行评估。

## 4 相关工作

智能体记忆系统存储可重用的工件,例如对话上下文和知识(MemGPT)(Packer 等,2023 (https://arxiv.org/html/2609.02129#bib.bib1))、观察和反思(Generative Agents)(Park 等,2023 (https://arxiv.org/html/2609.02129#bib.bib4))、可执行技能(Voyager)(Wang 等,2024 (https://arxiv.org/html/2609.02129#bib.bib5))和工作流(Agent Workflow Memory)(Wang 等,2025 (https://arxiv.org/html/2609.02129#bib.bib6))。AgentSM(Biswal 等,2026 (https://arxiv.org/html/2609.02129#bib.bib12))和MERIT(Wang 等,2026 (https://arxiv.org/html/2609.02129#bib.bib9))通过存储用于模式推理、规划和SQL生成的执行经验,将记忆扩展到数据智能体。相比之下,我们研究一个更小的记忆工件:发现记忆,表示为可重用的意图到对象映射。发现记忆不存储轨迹或推理过程,而是记录哪些数据对象被证明与任务相关,并将这些发现结果作为检索问题(R@5, MRR, F1@5)进行评估,而不是通过下游的规划、SQL生成或执行。

我们的工作还与模式链接和Text-to-SQL(Yu 等,2018 (https://arxiv.org/html/2609.02129#bib.bib17);Wang 等,2020 (https://arxiv.org/html/2609.02129#bib.bib16);Pourreza 和 Rafiei,2023 (https://arxiv.org/html/2609.02129#bib.bib15))、知识增强SQL系统(如KAT-SQL(Baek 等,2025 (https://arxiv.org/html/2609.02129#bib.bib10)))、元数据目录(如DataHub([18],2026 (https://arxiv.org/html/2609.02129#bib.bib18)))和数据发现系统(如Starmie(Fan 等,2023 (https://arxiv.org/html/2609.02129#bib.bib11)))有关。这些系统专注于模式链接、推理、查询生成、元数据管理或学习更好的对象表示。相反,我们研究成功的发现结果本身是否应该作为可重用的意图到对象映射跨任务持久化。

最接近的概念联系是相关性反馈(Rocchio,1971 (https://arxiv.org/html/2609.02129#bib.bib14);Salton 和 Buckley,1990 (https://arxiv.org/html/2609.02129#bib.bib13)),它重用历史相关性信号来改进未来的检索。发现记忆的不同之处在于,它操作的是智能体生成的对象选择而非用户交互信号,在语义相关但词汇不同的任务之间转移而非优化单个查询,并捕获任务意图与一组结构化对象之间的可重用映射而非文档级相关性。

## 5 讨论与结论

在三个结构上不同的领域中,持久化发现上下文在词汇和神经检索器下,始终在检索质量上优于仅基于元数据的搜索,并且在使用自动生成的记忆时仍然有效。这些发现表明,成功的发现结果本身值得被重用。

相似文章

面向主动型企业代理的Context Graphs

arXiv cs.AI

本文提出Context Graphs,一种用于企业实体的实时关系数据结构,使主动型代理能够在用户查询之前呈现相关信息,并形式化描述了增量检测、主动性评分以及基于LLM的呈现等组件。

PEEK:长上下文LLM代理的上下文图方向缓存

Hugging Face Daily Papers

本文介绍了PEEK系统,该系统将关于重复出现的外部上下文的定向知识缓存为上下文图,使得LLM代理能够跨调用复用上下文知识,并在长上下文推理和信息聚合任务上显著提高效率和准确性。