当智能体打开聊天应用:对原始聊天日志的智能体控制搜索媲美结构化记忆

arXiv cs.CL 论文

摘要

本文介绍了 ReFind,一种智能体控制的搜索界面,它使用词法索引和迭代关键词搜索对原始、未修改的聊天日志进行操作,表明它可以在对话记忆基准测试中媲美 HippoRAG 2 等结构化记忆系统,而无需构建任何语义结构。

arXiv:2608.12888v1 公告类型:新 摘要:智能体记忆系统日益以结构换取检索质量,在提出任何问题之前,将原始对话历史转换为摘要、嵌入、树或知识图谱。我们想问的是,这种收益有多大比例来自结构本身,而不是来自对原始历史的合格检索。我们提出了 ReFind,一种智能体控制的搜索界面,它完全不构建语义结构:它保持对话档案不变,在轮次粒度上进行词法索引,并将通用的迭代关键词搜索循环与四个基于实证再查找工作的聊天原生控制相结合:会话感知排名融合、局部上下文扩展、时间范围收窄,以及跳过已检查的会话。一个独立的推理阶段从收集到的证据中作答。在广泛的对话记忆任务套件(单跳和多跳问答、事件排序和事实整合)中,在 MemoryAgentBench 的增量多轮设置下评估了约 2,800 个关于精确检索和事实追踪能力的问题,ReFind 在所有比较系统中达到了最高的平均准确率(58.2),高于最强的基于图和树的记忆系统(HippoRAG 2,53.2),所有系统都使用了与每个复用基线匹配的 GPT-4o-mini 主干。对单次 BM25、匹配的通用智能体 BM25 对照、组件移除以及智能体密集/混合变体的对照比较分别支持了智能体控制、聊天原生控制和词法检索的作用。在 LongMemEval-S/M 上,同一界面在 GPT-5-mini 下达到 93.2 +/- 3.3 和 89.3 +/- 6.0。结果表明,对于基于聊天档案的精确、有证据依据的问题,归因于复杂记忆结构的许多收益可以通过让智能体对未修改记录进行可控搜索来恢复,而无需任何基于 LLM 的索引构建。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:27

# 当你的智能体打开聊天应用:智能体控制的原始聊天日志搜索比肩结构化记忆

来源:https://arxiv.org/html/2608.12888

1 中国科学技术大学 2 MetaStone Technology  
贡献[*] 在 MetaStone Technology 实习期间完成的工作。  
贡献[†] 通讯作者。

张立诚 徐本峰 杜明轩 付哲仁 陈伟东  
单位:\Affiliation:\[

2026年7月27日

###### 摘要

智能体记忆系统日益以结构换取检索质量:在提出任何问题之前,先将原始对话历史转化为摘要、嵌入向量、树或知识图谱。我们想问,这种收益有多少来自结构本身,又有多少仅仅来自对原始历史进行胜任的检索。我们提出ReFind——一种智能体控制的搜索接口,它完全不构建任何语义结构:它保持对话存档原封不动,在对话轮次粒度上进行词法索引,并将一个通用的迭代式关键词搜索循环与四项基于经验性重新查找研究的聊天原生控制相结合:会话感知排序融合、局部上下文扩展、时间范围收窄、以及跳过已检视会话。一个独立的推理阶段根据收集到的证据来作答。在一系列广泛的对话记忆任务(单跳和多跳问答、事件排序、事实整合)中,在MemoryAgentBench的增量式多轮设置下评估的约2,800个精确检索与事实追踪能力问题,ReFind取得了所有对比系统中最高的平均准确率(58.2),高于最强的基于图与树的记忆系统(HippoRAG 2, 53.2),且所有复用的基线均匹配同一GPT-4o-mini骨干模型。与单次BM25、匹配的通用智能体BM25对照、组件移除、以及智能体稠密/混合变体的受控比较,分别支持了智能体控制、聊天原生控制和词法检索的作用。在LongMemEval-S/M上,同一接口在GPT-5-mini下达到93.2±3.3和89.3±6.0。结果表明,对于聊天存档上精确、以证据为基础的问题,许多被归功于精心设计的记忆结构的收益,实际上可以通过让智能体对未修改的记录进行可控搜索来获得,且完全不需要基于LLM的索引构建。

## 1 引言

大语言模型(LLM)智能体已成为AI应用的核心范式,在工具使用、代码生成、科学问题求解和对话模拟方面展现出强大能力([Yao et al. 2022](https://arxiv.org/html/2608.12888#bib.bib40);[Shinn et al. 2023](https://arxiv.org/html/2608.12888#bib.bib29);[Wang et al. 2023a](https://arxiv.org/html/2608.12888#bib.bib31);[Park et al. 2023](https://arxiv.org/html/2608.12888#bib.bib23))。然而,当智能体处理长期任务和多轮交互时,它们面临一个根本瓶颈:记忆([Packer et al. 2023](https://arxiv.org/html/2608.12888#bib.bib21);[Zhang et al. 2024b](https://arxiv.org/html/2608.12888#bib.bib42);[Yan et al. 2025](https://arxiv.org/html/2608.12888#bib.bib38))。当交互历史增长到超出上下文窗口时,系统必须决定保留、压缩、检索或丢弃哪些信息([Liu et al. 2024](https://arxiv.org/html/2608.12888#bib.bib18);[Hsieh et al. 2024](https://arxiv.org/html/2608.12888#bib.bib12);[Hu et al. 2025](https://arxiv.org/html/2608.12888#bib.bib13))。

主导性的应对方式一直是**提前**施加结构。智能体记忆系统将原始交互历史转化为自写备忘录、递归摘要、向量库、树或知识图谱([Lu et al. 2023](https://arxiv.org/html/2608.12888#bib.bib19);[Wang et al. 2023b](https://arxiv.org/html/2608.12888#bib.bib32);[Chhikara et al. 2025](https://arxiv.org/html/2608.12888#bib.bib4);[Sarthi et al. 2024](https://arxiv.org/html/2608.12888#bib.bib28);[Edge et al. 2024](https://arxiv.org/html/2608.12888#bib.bib8);[Gutiérrez et al. 2024](https://arxiv.org/html/2608.12888#bib.bib10))。每一次这样的转化都是在问题未知之前下注:它决定抽象什么、丢弃什么,而预处理期间遗漏的细节可能难以在之后恢复([Packer et al. 2023](https://arxiv.org/html/2608.12888#bib.bib21);[Gutiérrez et al. 2025](https://arxiv.org/html/2608.12888#bib.bib11);[Yang et al. 2026](https://arxiv.org/html/2608.12888#bib.bib39);[Yan et al. 2025](https://arxiv.org/html/2608.12888#bib.bib38))。它还带来真实成本,因为索引必须离线构建,并随着新消息到达而重建或增量维护。

这就引出了一个随着越来越精巧的记忆架构不断累积而很大程度上未被检验的问题:它们报告的性能中,有多少来自结构本身,而不是仅仅来自对历史进行胜任的检索?为了探究这一点,我们走向相反的极端——完全不构建语义结构——并询问这一设定能被推到多远。

我们的答案基于个人信息重新查找的经验研究。自然观察表明,人们通常通过小而带有上下文指引的步骤到达已知目标,而不是一次性给出完整指定的关键词查询([Teevan et al. 2004](https://arxiv.org/html/2608.12888#bib.bib30))。一项直接的即时通讯研究发现,用户会将关键词尝试与滚动、时间或上下文地标相结合([Cheng and Aflatoony 2022](https://arxiv.org/html/2608.12888#bib.bib3));邮件研究同样将成功的重新查找与线程结构、本地浏览、时间和来源线索以及搜索历史状态联系起来([Whittaker et al. 2011](https://arxiv.org/html/2608.12888#bib.bib34);[Elsweiler et al. 2011](https://arxiv.org/html/2608.12888#bib.bib9);[Komlodi et al. 2007](https://arxiv.org/html/2608.12888#bib.bib15))。这表明应保留原始记录,并将智能从预先构建的语义索引转移到对搜索的自适应控制中。

我们将这一原则操作化为两层:一个**通用智能体循环**,负责发出关键词查询、检查结果、保存证据并重新表述;以及四项**聊天原生控制**,用于控制证据在对话记录中的位置——局部上下文扩展、会话感知排序融合、时间范围收窄和已检视会话过滤。这正是标题所指的:智能体**打开聊天应用**,像人一样追踪答案,而不是查阅预先为其构建的记忆。重新查找研究为这四个设计维度提供了动机,而我们的受控消融则测试了它们在一个智能体搜索系统中的功能贡献。

新颖之处在于这种系统级组合,以及确认它相对于结构化记忆和通用智能体检索分别带来了什么。在一系列广泛的对话记忆基准——单跳和多跳QA、事件排序和事实整合,约2,800个问题在MemoryAgentBench([Hu et al. 2025](https://arxiv.org/html/2608.12888#bib.bib13))的增量式多轮设置下进行评估——它在所有对比系统中取得了最高平均准确率,高于基于图的(GraphRAG、HippoRAG 2)和基于树的(RAPTOR)记忆系统,且所有复用的基线均匹配同一GPT-4o-mini骨干模型。在LongMemEval-S/M子集([Wu et al. 2024](https://arxiv.org/html/2608.12888#bib.bib35))上,这一优势在用更强的GPT-5-mini控制器进行的五次运行中同样得到复现。该接口由此用面向问题的在线计算取代了基于LLM的离线索引构建。

我们的贡献是:(1)ReFind——一个面向时间有序、会话结构化对话记忆的智能体可控搜索接口,结合词法检索与会话感知重排序、上下文扩展、时间过滤和已检视会话去重,由ReAct智能体驱动,在独立的答案生成阶段之前收集证据;(2)经验证据表明,在精确、以证据为基础的对话记忆问题上,只要由智能体控制搜索,许多被归功于精巧记忆结构的收益都可以在完全不构建任何结构、且没有任何基于LLM的索引构建的情况下获得;(3)对该接口适用范围的刻画——适用于精确检索与事实更新追踪,是对语义和低延迟记忆机制的补充。

## 2 相关工作

##### 智能体记忆系统。

人类记忆研究区分内部记忆与用于认知卸载的外部工件([Clark and Chalmers 1998](https://arxiv.org/html/2608.12888#bib.bib5);[Risko and Gilbert 2016](https://arxiv.org/html/2608.12888#bib.bib26)),而智能体记忆系统面临类似的选择:压缩为内部或半结构化记忆,或保留外部记录并从中检索。检索增强生成([Lewis et al. 2020](https://arxiv.org/html/2608.12888#bib.bib16))在推理时检索外部证据;Mem0([Chhikara et al. 2025](https://arxiv.org/html/2608.12888#bib.bib4))抽取结构化条目并存储为嵌入向量;A-Mem([Xu et al. 2025](https://arxiv.org/html/2608.12888#bib.bib36))将记忆组织为相互链接的笔记卡片;GraphRAG([Edge et al. 2024](https://arxiv.org/html/2608.12888#bib.bib8))、HippoRAG([Gutiérrez et al. 2024](https://arxiv.org/html/2608.12888#bib.bib10);[Gutiérrez et al. 2025](https://arxiv.org/html/2608.12888#bib.bib11))和Zep([Rasmussen et al. 2025](https://arxiv.org/html/2608.12888#bib.bib25))为多跳推理构建图或时间结构;RAPTOR([Sarthi et al. 2024](https://arxiv.org/html/2608.12888#bib.bib28))通过递归摘要构建层次树。其他系统则改变记忆载体:SeCom([Pan et al. 2025](https://arxiv.org/html/2608.12888#bib.bib22))将对话压缩为话题片段,MemoRAG([Qian et al. 2024](https://arxiv.org/html/2608.12888#bib.bib24))训练记忆模型以生成检索线索,MIRIX([Wang and Chen 2025](https://arxiv.org/html/2608.12888#bib.bib33))协调专门的记忆智能体。这些方法通过将对话预处理为紧凑表示来获得效率和抽象性,代价是离线构建过程必须随着存档增长而重复或增量维护。我们研究互补设定:保留完整的原始记录,并在压缩可能丢失信息时使用搜索来恢复精确细节。

表1:对话记忆系统的设计维度。无预处理:在问题到达之前没有基于LLM的离线索引构建。智能体式:模型自行发出多轮查询。会话:会话结构影响排序。时间:将显式时间过滤作为检索控制。去重:抑制跨搜索轮次的冗余。没有单一维度是新颖的;我们所研究的是它们的组合。
##### 个人信息重新查找。

用户研究为这些控制提供了行为学依据。在一项自然主义日记和观察研究中,参与者仅在39%的搜索中使用关键词搜索,而更常见的是通过小而局部化的步骤“寻路”,其上下文指导下一步行动([Teevan et al. 2004](https://arxiv.org/html/2608.12888#bib.bib30))。一项即时通讯使用研究(81份调查回复和14次访谈)报告了重访对话时的关键词尝试、滚动,以及基于时间、视觉和上下文的地标([Cheng and Aflatoony 2022](https://arxiv.org/html/2608.12888#bib.bib3))。在更大规模上,一项针对345名邮件用户和超过85,000次重新查找行为的现场研究发现,搜索和线程结构比复杂的预备性文件夹组织更有效,而滚动是最普遍的行为([Whittaker et al. 2011](https://arxiv.org/html/2608.12888#bib.bib34))。较小规模的研究进一步将邮件重新查找的困难与经过的时间和记忆中的时间或来源线索联系起来([Elsweiler et al. 2011](https://arxiv.org/html/2608.12888#bib.bib9)),并表明搜索历史支持进度追踪和任务管理([Komlodi et al. 2007](https://arxiv.org/html/2608.12888#bib.bib15))。这些发现为局部性、层次结构、时间顺序和跨轮次状态提供了动机;我们的消融测试了当这些维度被实现为面向智能体的检索控制时各自如何发挥作用。

##### 智能体式检索。

一些智能体系统让模型控制检索:MemGPT([Packer et al. 2023](https://arxiv.org/html/2608.12888#bib.bib21))在上下文和外部存储之间分页信息;Self-RAG([Asai et al. 2023](https://arxiv.org/html/2608.12888#bib.bib1))学习自适应检索决策;A-RAG([Du et al. 2026](https://arxiv.org/html/2608.12888#bib.bib7))为通用文档检索而非对话记忆提供关键词、语义和分块读取工具;GAM([Yan et al. 2025](https://arxiv.org/html/2608.12888#bib.bib38))将原始消息保存在页面存储中,并让研究者智能体进行多轮搜索。ReFind的决定性组合是通用迭代循环加上专门针对对话结构的控制:匹配轮次周围的局部扩展、时间约束、会话级排序融合,以及显式追踪已检视会话。表1(https://arxiv.org/html/2608.12888#S2.T1)将这些维度并列展示。

##### 记忆评估基准。

LongMemEval([Wu et al. 2024](https://arxiv.org/html/2608.12888#bib.bib35))通过五个维度的大海捞针任务评估长期记忆;MemoryAgentBench([Hu et al. 2025](https://arxiv.org/html/2608.12888#bib.bib13))将长上下文数据集重构为增量多轮格式,我们从中构建精确检索与事实更新基准;LoCoMo([Maharana et al. 2024](https://arxiv.org/html/2608.12888#bib.bib20))构建超长的300–600轮对话。我们的评估套件基于前两者构建。

## 3 方法

我们的系统将通用迭代检索与针对纯文本、带时间戳、会话结构化聊天历史的控制相结合。给定用户的大量对话历史和一个问题,系统通过两个解耦阶段生成答案:**检索**(迭代式证据收集)和**推理**(根据收集到的证据生成答案)。

##### “无结构”的含义。

ReFind使用聊天存档中已有的组织——轮次边界、会话标识符、时间戳和原始文本——但不会创建任何学习得到的或LLM生成的记忆表示。BM25索引是访问原始文本的路径,而非替代性记忆:添加一条消息只是追加其令牌和元数据,而不会摘要较早内容、抽取实体、构建图或重写记忆卡片。这一区分使比较具有可操作性。结构化系统在看到未来问题之前就决定如何表示一条记录;ReFind则将该决定推迟到查询时,此时智能体知道自己需要什么证据。

### 系统架构

在**阶段1(检索)**中,一个ReAct风格([Yao et al. 2022](https://arxiv.org/html/2608.12888#bib.bib40))的智能体循环让LLM自主决定搜索关键词和参数,使用下述搜索引擎对历史进行多轮搜索(图1(https://arxiv.org/html/2608.12888#S3.F1)),并将有价值的片段保存为笔记。一轮搜索可以利用前一观察结果:智能体可以用一个独特实体替换不成功的短语,在发现时间线索后收窄日期范围,或搜索多跳问题所需的第二个事实。在**阶段2(推理)**中,收集到的笔记按会话分组、按时间排序,并与问题一起用于答案生成。这一分离防止答案生成过

相似文章

rohitg00/agentmemory

GitHub Trending (daily)

agentmemory 是一个开源的持久化记忆层,专为 AI 编程智能体(Claude Code、Cursor、Gemini CLI、Codex CLI 等)设计。它通过知识图谱、置信度评分和混合搜索技术,借助 MCP、Hooks 或 REST API,为智能体提供跨会话的长期记忆能力。该项目基于 iii 引擎构建,无需外部数据库,提供 51 个 MCP 工具。

@yyyole: Agent memory的创业方向好火爆! 很多团队都在做,大概有下面几种比较主流的思路: 第一种最粗暴:context路线,把上下文增长。 第二种最常见:RAG / 向量库路线,接一个向量库把历史内容 embedding 后做检索。 第…

X AI KOLs Timeline

介绍Agent memory创业的几种主流思路,并推荐EverMind团队的开源项目EverOS,它提供以Markdown为源的本地记忆操作系统,支持双轨记忆、多模态摄取和自演化能力。