RECON:面向长上下文组合推理的智能体记忆基准测试
摘要
介绍RECON,一个用于评估基于LLM的智能体在长上下文中组合推理能力的基准测试,涵盖刑事、医疗和金融领域的24个案例文件。最佳非Oracle系统仅达到22.4%的准确率,揭示了当前记忆架构的严重局限性。
arXiv:2607.16716v1 公告类型:新
摘要:大型语言模型及基于LLM的智能体被广泛用作用个人聊天助手、企业副驾驶以及自主工作流智能体。在这些应用中,记忆(即在长上下文和多次交互中积累信息的保留、访问和推理能力)在决定智能体可靠性方面起着关键作用。我们引入了RECON(基于混淆叙事的长上下文推理),这是一个用于评估长上下文组合推理的基准测试。RECON涵盖三个领域(刑事、医疗和金融)的24个案例文件,每个文件范围从50k到100k token,并测试智能体在六项记忆密集型任务上的表现:重建多跳证据链、传播级联失效、解决源冲突、反事实推理、满足时间约束以及时间事实检索。最近的记忆基准测试评估智能体能否检索分散的事实或检测事实是否发生变化,而RECON则评估变化后的情况:智能体能否追踪哪些下游结论受到影响,哪些通过独立支持而幸存,以及替代时间线会如何展开。我们的评估揭示了当前架构的严重局限性:即使是最强的非Oracle系统也仅达到22.4%的准确率,检索和推理各自成为挑战。
查看缓存全文
缓存时间: 2026/07/21 06:39
# RECON:面向长上下文组合推理的智能体记忆基准测试
来源:https://arxiv.org/html/2607.16716
Mihir Shriniwas Arya
计算机科学与工程系
RV工程学院
mihirsarya\.cy23@rvce\.edu\.in
###### 摘要
大型语言模型及基于LLM的智能体被广泛用作个人聊天助手、企业副驾驶和自主工作流智能体。在这些应用中,记忆(即在长上下文和多次交互中保留、访问和推理所积累信息的能力)对于决定智能体的可靠性至关重要。我们提出RECON(面向混淆叙事的扩展上下文推理),这是一个评估长上下文组合推理能力的基准测试。RECON涵盖3个领域(刑事、医疗、金融)共24个案卷,每个案卷约5万至10万个词元,并测试智能体在六项记忆密集型任务上的表现:重构多跳证据链、传播级联失效、解决来源冲突、反事实推理、满足时间约束以及时序事实检索。近期记忆基准测试主要评估智能体能否检索散落事实或检测事实是否已变化,而RECON则评估变化之后会发生什么——智能体能否追踪哪些下游结论受影响、哪些因独立支撑而幸存,以及替代时间线会如何展开。我们的评估揭示了当前架构的显著局限性:即使最强的非Oracle系统也仅达到22.4%的准确率,其中检索与推理各自构成挑战。我们的基准测试和代码已发布在 https://anonymous.4open.science/r/RECON-Bench。
RECON:面向长上下文组合推理的智能体记忆基准测试
Mihir Shriniwas Arya
计算机科学与工程系
RV工程学院
mihirsarya\.cy23@rvce\.edu\.in
参见图注
图1:RECON评估的六项记忆密集型任务。
## 1 引言
基于大型语言模型的智能体正承担着日益高风险的工作。像Claude Code和GitHub Copilot这样的编码助手必须跨整个代码库追踪上下文(Ding等人,2023;Liu等人,2024);ChatGPT和Claude等对话智能体必须保留随时间变化的用户偏好和指令(Wu等人,2025;Du等人,2024);企业副驾驶则需要在临床、法律和金融工作流中对不断演变的文档进行推理(Fleming等人,2023)。如果没有稳健的记忆,智能体会忘记早期事实已被修订——无论第9天更新的实验室结果、第5天矛盾的证人陈述,还是被逆转的标记交易——从而产生陈旧事实的幻觉、遗漏关键更新,并失去对早期证据与后续结论之间联系的把握。记忆质量直接决定了在此基础上构建的一切的质量。记忆的重要性催生了一波记忆架构,如Mem0(Chhikara等人,2025)、Zep(Rasmussen等人,2025)、MemGPT(Packer等人,2023)和Hindsight(Latimer等人,2025),它们对先前的交互进行索引、图表化、分页或摘要。除了这些记忆架构,RAG方法将文档嵌入向量存储库,并在查询时检索相关块。现代长上下文模型拥有10万至100万以上词元的窗口,可将完整上下文放入单个提示中。每种策略都在准确度与成本之间权衡,但根本问题不变:智能体记住的不仅是事实,还有每个结论依赖什么?
我们提出RECON(面向混淆叙事的扩展上下文推理),这是一个基准测试,用于评估智能体在长上下文中能否保持连贯且不断演变的理解——在这里,事实不仅积累,还会交互、矛盾并级联。RECON涵盖3个领域(刑事、医疗、金融)共24个案卷、1604个问题,每个案卷5万至10万个词元,具有完全确定性的真实答案。它测试智能体在六项记忆密集型任务上的表现,如图1所示。
1. 1. 链重构:定位并因果排序散落在文档中的5–15个证据跳。
2. 2. 级联传播:在失效事件发生后,确定哪些结论失效、哪些因独立支撑而幸存。
3. 3. 来源冲突解决:利用独立佐证证据裁决相互矛盾的陈述。
4. 4. 反事实推理:确定在替代时间线下会发生什么变化。
5. 5. 时间约束满足:跨参考并行数据流与时间窗口。
6. 6. 时序事实检索:基础的时序排序、状态查询和消去(控制组)。
现有记忆基准测试评估智能体能否检索散落事实或检测事实是否变化,将记忆建模为状态机,其中事实具有需追踪的当前值。但仅追踪当前值是不够的:在实际工作流中,事实通过明确的依赖结构进行交互、失效和级联。
#### 贡献。
- • RECON基准测试:3个领域24个案卷(5万–10万词元)共1604个问题,涵盖六种任务类型,基于演变的证据而非静态证据。人类验证在200个问题上报告κ=0.69。
- • 确定性生成流水线:六层生成器将每个案例构建为具有显式失效和反事实的溯源图,所有真实答案由代码推导而非LLM。
- • 对长上下文LLM、RAG变体及记忆增强智能体在RECON上的实证研究,分析跨任务类别的性能,并识别开放挑战。我们发布数据集、生成器和评估框架。
## 2 相关工作
表1将RECON与先前的长上下文和记忆基准测试在六种任务类型上进行对比。
表1:RECON与先前基准测试的对比。✓/○/× = 已测试/部分测试/未测试。Dyn. = 文档在单个案例中包含显式事实更新。任务列:CR-c(链重构)、CP(级联传播)、SC(来源冲突)、CF(反事实)、TC(时间约束)、TFR(时序事实检索)。
### 2.1 长上下文评估
长上下文基准测试评估模型能否检索并理解分布在长输入中的信息。LongBench(Bai等人,2024)、RULER(Hsieh等人,2024)和∞-Bench(Zhang等人,2024)建立了早期基线,并将评估推至10万词元以上;RULER特别表明有效上下文窗口远低于宣称的限制。NoCha(Karpinska等人,2024)引入了全局推理密集型的真/假陈述,GPT-4o在其上的配对准确率仅达55.8%。最近的基准测试(LongBench v2(Bai等人,2025)、HELMET(Yen等人,2025)、LooGLE v2(He等人,2025))将这些工作扩展到10万词元以上的多跳设置,LooGLE v2在高达200万词元的文档上仅报告59.2%的准确率。这些基准测试评估的是对静态文档的理解。而RECON围绕随时间演变的文档构建:随着新事实出现、早期事实被修订或失效,智能体必须追踪哪些结论仍然成立。
### 2.2 记忆基准测试
第二类工作评估跨累积历史的记忆能力。LoCoMo(Maharana等人,2024)提供了300轮对话历史,包含多跳、时序和对抗性问题。PerLTQA(Du等人,2024)扩展到3409个对话中的8593个个人记忆问题。LongMemEval(Wu等人,2025)针对时序状态追踪,发现最先进的系统在跨会话知识更新上持续失败。MemAE(Hu等人,2025)将记忆定义为四种能力(准确检索、测试时学习、长程理解、选择性遗忘)。TRACK(Feng等人,2026)通过在多步推理链中注入冲突事实更新来扩展这条线,但限于段落规模且沿单一链,而非RECON评估的二部依赖结构。在这些基准测试中,记忆被建模为状态机,其事实具有需追踪的当前值。RECON则将其建模为溯源图,其中结论具有推导历史:当证据被失效时,智能体必须确定哪些结论失去基础,哪些仍受独立证据支持。
### 2.3 调查与叙事推理
第三类工作测试对叙事文档的多跳推理,建立在多跳QA传统之上(Yang等人,2018;Ho等人,2020;Trivedi等人,2022)。MuSR(Sprague等人,2024)引入了约1000词元的合成叙事(包括谋杀谜案),探索思维链推理,但文档简短且不含事实更新。DetectiveQA(Xu等人,2025)和NovelHopQA(Gupta等人,2025)使用约10万词元和6.4万–12.8万词元的真实小说,包含多跳问题,但作为已出版文本,它们没有受控失效、来源冲突或反事实结构。TurnaboutLLM(Yuan等人,2025)从游戏脚本中提取矛盾;它与来源冲突有重叠但限于单一任务。
## 3 RECON基准测试
### 3.1 概述
RECON包含24个案例和1604个问题,覆盖刑事、医疗和金融领域(上下文字数5万–10万词元)。每个案例嵌入证据链、形式化失效、来源冲突、反事实依赖以及并行时间流,通过确定性生成并转化为自然语言。系统仅能看到叙述化的案卷。
### 3.2 生成流水线
图2展示了RECON在叙述化之前的确定性真实答案构建。
参见图注
图2:单个证据线索的端到端RECON生成:在LLM叙述化之前,真实答案完全由确定性方法建立。
所有案例结构由确定性代码生成。LLM仅执行受约束的表面实现,从不影响因果结构、溯源或答案键;所有输出在发布前均经过后验证。
#### 属性条件蓝图合成。
每个案例源自确定性、基于种子的生产引擎,其结构类似于语法:一个有限的有类型终端目录(角色、地点、证据模板)通过有序的生产规则扩展成完整的案例蓝图。我们将生成器形式化为 G = (D, A, P, C),其中 D 是领域目录,A 是属性集合(表示当前生成状态的有类型事实标签),P 是生产规则集合,C 是硬全局不变量(时间单调性、罪魁祸首唯一性、配额满足)。每条规则 p ∈ P 携带一个需求集 R_p ⊆ A 和一个建立集 E_p ⊆ A:规则 p 仅在 R_p ⊆ S_t(当前状态满足其前提条件)时触发,触发后更新状态 S_{t+1} = S_t ∪ E_p。这一契约确保每个生成的发现逻辑上由其先决条件所先导,并直接从生成轨迹中诱导出溯源DAG,而非事后恢复。给定种子 s、领域 d 和配额 q,合成是确定性的(B = G(s, d, q))。
#### 骨架扩展与时间强制。
蓝图扩展为结构化的带时间戳事件骨架、证据项、因果依赖、失效、来源冲突、反事实依赖以及并行时间流(监控、访问、交易、临床或审计)。时间一致性通过字典序单调时间约束强制执行:每个节点携带 τ(v) = (day, time),并且对于每条因果边 u → v,τ(v) ≥_lex τ(u)。在叙述化之前,后骨架验证器会检查这些约束。
#### 溯源DAG与证明轨迹接地。
骨架诱导出一个全局溯源DAG,其节点为事件、证据项和结论,带类型边编码因果、修订、失效和冲突解决关系。边 u → v 的存在当且仅当条目 u 建立的属性被条目 v 所需,因此图直接从生成契约中读取,而非推断而得。此图是权威的案例表示;叙述化的散文是其下游产物,而非反过来。每个问题都携带一个证明轨迹:DAG的最小生成子图,其节点是推导答案所必需且充分的,从而在不依赖LLM推理的情况下锚定答案推导,并固定验证器的接地检查。因此,答案性由构造保证:每个金标准答案均可从该确定性结构推导得出,后问题验证器在发布前强制执行唯一性。
#### 确定性任务合成。
问题从溯源DAG中算法生成:链重构项采样多跳路径;级联项选择失效节点并通过可达性计算哪些结论崩溃、哪些幸存;冲突项定位独立佐证节点;反事实项移动时间戳并重新计算可达性;时间约束项查询流交集;时序事实检索探测单一源的时序事实。固定问题矩阵(表4)规定了每任务和每格式的配额。干扰项遵循预定义的推理失败分类法(附录E)。
#### 语言实现。
在确定性构造之后,LLM叙述器在严格的事实保真约束下将骨架条目转换为调查风格散文:它可以选择措辞、语气和感官细节,但骨架字段(时间戳、来源类型、实体、证据标识符、事实内容)被视为不可变。叙述化后的验证交叉检查时间戳、实体标识符和证据ID与骨架的匹配;失败项在发布前重新叙述。
### 3.3 任务类别
RECON包含六项记忆密集型任务类别。分类法跨领域固定,而具体实体、证据类型和时间流在各领域间变化。相似文章
RealICU:大型语言模型代理是否能理解长上下文ICU数据?一个超越行为模仿的基准测试
RealICU是一个事后标注的基准测试,用于评估ICU场景中的大型语言模型(LLM),涵盖四个由医生驱动的任务。实验表明,现有LLM在回忆-安全权衡和锚定偏差方面存在困难,而一种新的结构化记忆代理改善了推理能力,但未能完全消除安全故障。
记忆是重构的,而非检索:LLM 代理的图记忆
MRAgent 提出了一种新颖的基于图的记忆框架,能在推理过程中动态重构记忆,在长程基准测试上实现高达 23% 的性能提升,同时降低了计算成本。
面向长期LLM代理的检索驱动记忆再巩固
本文介绍了REALM,一个用于LLM代理长期记忆的框架,它利用检索驱动的再巩固来自主地将记忆组织成认知图,从而在长期记忆基准测试中取得更好的性能。
IFCMemoryBench:评估基于LLM的智能体在BIM信息检索中的长期记忆
本文介绍了IFCMemoryBench,一个经过人工验证的基准测试,用于评估基于LLM的智能体在BIM信息检索中的长期记忆。研究表明,当前的记忆系统仅能达到32.4%的答案准确率,揭示了智能体记忆中的领域迁移差距。
当用户未提问时:对话代理中上下文驱动记忆检索的基准测试
本文介绍了LoCoMo-Conv,一个对话记忆基准,用于评估长期对话代理中使用不同查询风格的记忆检索和响应质量,揭示了现有QA基准中的差距,并建议基于推理的记忆细化作为一个有前景的方向。