保持铭记:评估智能体记忆中的内隐关联盲点

Hugging Face Daily Papers 论文

摘要

介绍 InMind Memory Bench,一个用于评估智能体记忆系统中内隐关联盲点的基准测试。该盲点表现为当表面相似度较低时,仅依赖检索的记忆无法应用相关的世界知识。

长时记忆系统将用户所说的内容存储在外部队列中,并在相关查询到达时检索出来。这种交互界面基于一个非常自然以至于很少被明确提出的假设:所需的记忆将与需要它的查询相似。世界知识打破了这一假设。例如,对树坚果过敏会通过马卡龙的杏仁粉成分改变对该请求的回答,然而这两段文本之间没有检索器能看到的线索。我们将这种失败模式称为内隐关联盲点,并引入了 InMind——一个包含125个任务、经过专家验证的基准测试,涵盖十个生活领域,其中113个任务基于可引用的公开来源。其配对控制实验区分了现有评估常常混淆的三种解释:事实从未被存储、模型缺乏桥接知识、或者事实被存储但从未被检索。结论是清晰的。当决定性的记忆被置于上下文中时,主干模型能够正确回答84.0%的间接查询;而当同样的记忆必须被检索时,六个向量、图及智能体记忆系统最多只能达到14.4%,尽管它们按需召回相同事实的准确率高达100%。一个维度增大八倍的嵌入方法提高了每个系统的无目标召回率,但差距基本保持不变。一个在查询到达前保持记忆可见的最小诊断探针恢复了大部分差距,将失败定位在查询条件化的交互接口本身,并指出路由(即决定哪些事实必须保持可见)是 InMind 旨在评分的开放问题。
查看原文
查看缓存全文

缓存时间: 2026/07/29 03:50

Paper page - Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

来源:https://huggingface.co/papers/2607.24368

我们要提出一个观点:

Agent 记忆不能仅仅是检索式的。

仅靠检索的记忆更接近笔记本,而非人类记忆。

笔记本可以完美存储信息,但它只在你知道需要查阅时才有用。人类记忆则不同:重要事实能持续塑造我们的判断,而世界知识可以将表面上毫不相关的事物联系起来。

然而,目前大多数 agent 记忆系统都像笔记本一样。它们将用户信息写入外部存储,然后在新查询到来时检索“相关的”记忆。无论是向量数据库、知识图谱还是 agentic RAG,其基本流程通常都是:

首先根据查询判定什么相关,然后让模型推理。

这种顺序会造成一个结构性盲区。

用户说:

“我对树坚果过敏。”

之后,他们问:

“我想尝试做马卡龙。有什么食谱吗?”

一个好的 agent 应该提醒他们传统马卡龙使用杏仁粉。但许多记忆系统只是直接提供食谱:因为“树坚果过敏”和“马卡龙”不够相似,过敏记忆根本不会被检索到。

或者考虑这个例子:

“我家里有百合花。”“我想养一只猫。”

一个好的 agent 应该提醒百合花对猫毒性极强,需要先移除。但一个仅检索的系统可能只会给出养猫的一般建议,因为“百合花”和“猫”几乎没有表面上的相似性。

更麻烦的是,这些系统在直接回答问题时可能表现得完美无缺:

“我对什么过敏?”“我家有哪些植物?”

所以用户会相信这个 agent 真的记住了——并且会“铭记”——他们的重要信息。

但这可能是一个虚假承诺:记忆存在于数据库中,却在真正需要时未能影响 agent 的行为。

我们测试了当前代表性的最先进记忆系统,包括 HippoRAG 2、A-RAG、A-Mem、Mem0、MemoryOS 和 xMemory。在这些案例中,它们表现出相同的系统性失败模式:可以在需要时回忆起事实,但在需要世界知识桥梁时却无法应用。

为了衡量这一现象,我们引入了 InMind Memory Bench,一个用于 agent 记忆中隐式关联盲区的基准测试。

检索是必要的,但仅有检索还不够。

一个可靠的 agent 记忆需要回答一个更困难的问题:不仅要知道“现在应该检索什么?”,还要知道“哪些信息必须保持可用,因为它可能在当前查询没有揭示的方式下产生影响?”

相似文章