SubtleMemory:面向长期AI代理的细粒度关系记忆辨别基准

Hugging Face Daily Papers 论文

摘要

SubtleMemory是一个用于评估AI代理在长期交互中细粒度关系记忆辨别能力的基准,包含10个长历史中的1,522个实例。它揭示了当前记忆系统在保存和利用细微记忆关系方面的局限性。

持久型AI助手(如OpenClaw)在长期交互中会积累大量相关的记忆。随着这些记忆的增长,它们可能相互加强、在不同上下文中产生分歧,或直接冲突,使得正确的辅助依赖于记忆关系而非孤立的回忆。现有的长期记忆基准很少探究代理在下游任务中如何保存和利用这些关系。为填补这一空白,我们提出了SubtleMemory,一个用于评估长期运行的AI代理的细粒度关系记忆辨别能力的基准。SubtleMemory构建了关系控制的潜在语义工件的变体,这些变体实例化互补、细微或矛盾的关系,并将其嵌入到真实的用户-代理历史中,要求代理在后续的查询和指令中恢复分布式的关系结构。该基准包含10个长历史中的1,522个评估实例,基于1,090个关系控制的记忆变体集,涵盖用户相关和非用户相关的查询。通过评估六个独立的记忆系统、两个带有原生记忆模块的Claw风格代理以及三个带有插件记忆模块的Claw风格代理,我们发现当前系统在细粒度关系记忆辨别方面仍然薄弱。我们进一步引入了诊断协议,揭示了在记忆保存、检索和下游推理阶段的不同能力概况。
查看原文
查看缓存全文

缓存时间: 2026/06/08 03:29

论文页面 - SubtleMemory:面向长程AI智能体的细粒度关系记忆判别基准

来源:https://huggingface.co/papers/2606.05761

摘要

SubtleMemory 基准评估了 AI 智能体处理在长时间交互中涌现的复杂关系记忆结构的能力,揭示了当前记忆系统在保留和利用细微记忆关系方面的局限性。

持续性 AI 助手(如 OpenClaw)会在长期交互中积累大量相互关联的记忆。随着这些记忆的增长,它们可能相互强化、在不同情境下出现分歧或直接冲突,导致正确的辅助依赖于记忆关系而非孤立的回忆。现有的长期记忆基准很少探究智能体在下游任务中如何保留和利用这些关系。为填补这一空白,我们提出了 SubtleMemory,一个针对长时间运行 AI 智能体进行细粒度关系记忆判别的基准。SubtleMemory 构建了关系控制的潜在语义工件,其变体呈现出互补、细微或矛盾的关系,并将这些工件嵌入到真实的用户-智能体历史中,要求智能体在后续查询和指令中恢复分布式的关系结构。该基准包含基于 1,090 个关系控制记忆变体集的 10 段长历史,共计 1,522 个评估实例,涵盖用户相关和用户无关的查询。通过评估六种独立记忆系统、两种带有原生记忆模块的 Claw 风格智能体以及三种带有插件记忆模块的 Claw 风格智能体,我们发现当前系统在细粒度关系记忆判别方面仍然较弱。我们进一步引入了诊断协议,揭示了记忆保留、检索和下游推理阶段不同的能力特征。

查看 arXiv 页面 (https://arxiv.org/abs/2606.05761) 查看 PDF (https://arxiv.org/pdf/2606.05761) 项目页面 (https://yummytanmo.github.io/SubtleMemory/) GitHub3 (https://github.com/Yummytanmo/SubtleMemory) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05761)

在您的智能体中获取此论文:

hf papers read 2606\.05761

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.05761 即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.05761 即可从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.05761 即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到一个收藏集中即可从此页面链接。

相似文章

保持铭记:评估智能体记忆中的内隐关联盲点

Hugging Face Daily Papers

介绍 InMind Memory Bench,一个用于评估智能体记忆系统中内隐关联盲点的基准测试。该盲点表现为当表面相似度较低时,仅依赖检索的记忆无法应用相关的世界知识。

Memora: 平衡抽象与具体性的和谐记忆表示

Hacker News Top

Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。

MEME:多实体与动态记忆评估

Hugging Face Daily Papers

MEME 基准测试在多实体和动态变化的条件下评估 AI 记忆系统,揭示了即便采用先进的检索技术,在依赖关系推理方面依然存在显著挑战。