先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
摘要
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
查看缓存全文
缓存时间: 2026/05/27 02:48
论文页面 - Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon Agents
来源:https://huggingface.co/papers/2605.25535
摘要
基于大语言模型的记忆系统可以通过适应个体用户上下文的个性化策略获益,但精确实现仍具挑战性。
现有基于大语言模型(https://huggingface.co/papers?q=large%20language%20model)(LLM)的记忆系统(https://huggingface.co/papers?q=memory%20systems)采用通用的静态策略,忽略了一个基本事实:值得存入记忆的上下文因用户而异。这种错位浪费了有限的记忆预算(https://huggingface.co/papers?q=memory%20budget)在短暂交互(https://huggingface.co/papers?q=transient%20interactions)上,同时无法为长期任务(https://huggingface.co/papers?q=long%20horizon%20tasks)保留关键上下文。为解决这一差距,我们探索了一个尚未充分研究的问题:基于LLM的记忆系统(https://huggingface.co/papers?q=memory%20systems)能否学习个性化记忆策略(https://huggingface.co/papers?q=personalized%20memory%20policies)?我们引入了PerMemBench(https://huggingface.co/papers?q=PerMemBench),这是首个评估个性化记忆系统(https://huggingface.co/papers?q=memory%20systems)的基准,包含跨多年、多领域、跨不同用户角色的交互历史。我们进一步提出了首个记忆个性化的实证研究,提出了会话级存储门控(https://huggingface.co/papers?q=session%20level%20storage%20gating),一个轻量级框架,可选择性地绕过短暂会话的记忆操作。我们的研究证实,在完美门控下个性化能带来显著的留存增益,但揭示出精确门控仍是一个开放且关键性的挑战。
查看arXiv页面(https://arxiv.org/abs/2605.25535)查看PDF(https://arxiv.org/pdf/2605.25535)GitHub1(https://github.com/yeonjun-in/PerMemBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.25535)
在你的智能体中获取此论文:
hf papers read 2605.25535
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2605.25535 即可从本页链接。
引用此论文的数据集0
无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.25535 即可从本页链接。
引用此论文的 Space0
无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2605.25535 即可从本页链接。
包含此论文的收藏0
无收藏包含此论文
将本篇论文添加到收藏(https://huggingface.co/new-collection)即可从本页链接。
相似文章
FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
Introduces FinPerMA, an event-grounded benchmark for evaluating personalized memory in LLM agents for financial advising, showing that current models and memory systems remain far from saturated.
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
AgentMemBench:评估对话式AI智能体长期记忆管理策略的系统性基准
AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。
MemArena:一种面向大规模设备端智能个人记忆助手的自我中心基准
MemArena 是一种新的自我中心基准,用于评估设备端个人记忆助手,它使用 MASim 智能体模拟器生成多会话对话世界,并在回忆、推理和可信度维度上提供真值。初步结果表明,记忆后端的选择通常比读取器规模更重要,而基于权限的访问仍然是一个普遍挑战。
MemPrivacy:面向边缘-云智能体的隐私保护个性化记忆管理
MemPrivacy 是一项研究,介绍了一种用于边缘-云 AI 智能体的隐私保护个性化记忆管理框架,该框架利用类型感知占位符在保护敏感数据的同时维持语义效用。本文包含一个新的基准数据集,并展示了其性能优于 GPT-5.2 和 Gemini-3.1-Pro 等通用模型。