PRAGMA:在长期对话中评估个性化指导与记忆对齐
摘要
本文介绍了PRAGMA,一个用于评估长期对话中个性化指导的基准,揭示了当前大型语言模型系统在用户特定指导的有效记忆检索和推理方面存在困难。
arXiv:2609.09664v1 Announce Type: new
摘要:大型语言模型(LLMs)越来越多地被部署为与用户长期交互的个性化助手。随着对话变得越来越长,依赖完整的交互历史记录变得越来越低效且不可靠:长上下文引入了大量计算开销,使得模型难以持续识别并利用与当前请求最相关的信息。这些挑战促使了记忆系统的产生,这些系统能够结构化和检索用户特定信息。在现实交互中,用户通常寻求实用指导,如推荐、规划和决策支持。与事实回忆任务不同,个性化指导要求模型整合多个过去对话中的信息,并对用户不断变化的偏好和经验进行推理。然而,现有的对话记忆评估主要关注检索和事实回忆。为了研究这一挑战,我们引入了PRAGMA,一个用于评估长期对话中个性化指导的基准。PRAGMA包含精心策划的纵向对话历史、证据注释以及基于不断演变的用户上下文和错误用户假设的指导场景。跨检索系统、记忆系统和长上下文模型的实验揭示,当前系统在恢复适当的对话证据和有效利用其进行个性化指导方面都存在困难。我们的结果凸显了需要支持健壮对话检索和超越证据回忆的记忆基础推理的记忆架构。
查看缓存全文
缓存时间: 2026/09/11 08:39
# PRAGMA:在终身对话中通过记忆对齐评估个性化指导 来源:https://arxiv.org/html/2609.09664 作者: Hyukhun Koh 隶属机构:IPAI,首尔国立大学 邮箱:[[email protected]](mailto:) Minsung Kim 隶属机构:电子与计算机工程系,首尔国立大学 邮箱:[[email protected]](mailto:) Yunah Jang 隶属机构:电子与计算机工程系,首尔国立大学 邮箱:[[email protected]](mailto:) Kyomin Jung 隶属机构:电子与计算机工程系,首尔国立大学 隶属机构:IPAI,首尔国立大学 邮箱:[[email protected]](mailto:) ###### 摘要 大型语言模型(LLMs)正日益被部署为个性化助手,与用户进行长时间交互。随着对话变得越来越长,依赖完整的交互历史变得越来越低效且不可靠:长上下文会带来巨大的计算开销,使模型难以持续识别和利用与当前请求最相关的信息。这些挑战促使了结构化和检索用户特定信息的记忆系统的发展。在实际交互中,用户经常寻求实用的指导,如推荐、规划和决策支持。与事实回忆任务不同,个性化指导需要模型整合多次过去对话的信息,并推理不断变化的用户偏好和经验。然而,现有的对话记忆评估主要集中在检索和事实回忆上。为了研究这一挑战,我们引入了Pragma,一个用于评估长期对话中个性化指导的基准。Pragma包含精心策划的纵向对话历史、证据标注以及基于不断变化的用户上下文和错误用户假设的指导场景。在检索系统、记忆系统和长上下文模型上的实验表明,当前系统在恢复适当的对话证据以及有效利用其提供个性化指导方面均存在困难。我们的研究结果凸显了支持稳健对话检索和超越证据回忆的记忆基础推理的记忆架构的必要性。 $\\dagger$$\\dagger$脚注:通讯作者。 \*脚注:代码和数据可在以下地址获取:https://github.com/yuhyojeong/PRAGMA 和 https://huggingface.co/datasets/stellahj/PRAGMA。 ## 1 引言 参见标题 图 1:个性化指导需要有效的对话检索和下游记忆基础推理。相关证据可能在时间上分散,并且仅与最终用户请求隐式关联。尽管两个响应都使用了检索到的记忆,但只有右侧响应正确综合了用户的纵向上下文。 | 基准名称 | 上下文内查询 | 开放式生成 | 个性化指导 | 事件对齐 | 事件纠正 | 轨迹对齐 | 轨迹纠正 | 上下文长度(约) | | :--- | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :--- | | LongMemEval | ∘ | ∘ | × | △ | △ | × | × | 115K, 1.5M | | LoCoMo | × | × | × | – | – | – | – | 9K | | HiCUPID | ∘ | ∘ | △ | △ | ∘ | × | × | 17K | | ImplexConv | ∘ | ∘ | ∘ | ∘ | ∘ | × | × | 60K | | ConvoMem | ∘ | △ | △ | ∘ | × | × | × | 1K–3M | | PersonaMem | ∘ | × | ∘ | ∘ | ∘ | × | × | 32K–1M | | PRAGMA | ∘ | ∘ | ∘ | ∘ | ∘ | ∘ | ∘ | 160K | 表 1:长期对话记忆基准比较。上下文内查询:查询嵌入在对话中;开放式生成:开放式生成;个性化指导:个性化指导;事件对齐/事件纠正 和 轨迹对齐/轨迹纠正:事件和轨迹基础的对齐/纠正推理。上下文长度:近似上下文长度。∘:支持,△:部分支持,×:不支持。 大型语言模型(LLMs)正日益被部署为个性化对话助手,与用户进行长时间交互Li et al. (2025a) (https://arxiv.org/html/2609.09664#bib.bib2);Tan et al. (2025) (https://arxiv.org/html/2609.09664#bib.bib3)。推荐代理、导师和生产力助手等应用依赖于在交互过程中感知用户的偏好、经验和不断变化的需求。随着对话历史越来越长,基于完整历史进行条件化变得越来越低效且不可靠,这推动了选择性存储和检索用户特定信息的记忆系统的发展Zhong et al. (2024) (https://arxiv.org/html/2609.09664#bib.bib1)。现有对话记忆工作主要集中在从长历史中检索和回忆事实Wu et al. (2025) (https://arxiv.org/html/2609.09664#bib.bib9);Maharana et al. (2024) (https://arxiv.org/html/2609.09664#bib.bib4)。然而,现实世界中的个性化通常需要实用的指导Chatterji et al. (2025) (https://arxiv.org/html/2609.09664#bib.bib5),例如基于不断变化的用户体验的推荐、规划支持和决策制定。这些查询通常需要对长期用户轨迹和可能错误的用户假设进行推理Feng et al. (2026) (https://arxiv.org/html/2609.09664#bib.bib6);Sharma et al. (2024) (https://arxiv.org/html/2609.09664#bib.bib8)。此外,相关证据通常在时间上分散,并且仅与最终用户请求隐式关联,这使得对话检索本身也具有挑战性。因此,个性化指导不仅取决于检索相关记忆,还取决于在响应生成过程中连贯地利用它们Kwon et al. (2026) (https://arxiv.org/html/2609.09664#bib.bib7)。然而,检索与下游个性化推理之间的关系仍未得到充分探索Laban et al. (2026) (https://arxiv.org/html/2609.09664#bib.bib25);Li et al. (2026) (https://arxiv.org/html/2609.09664#bib.bib26)。为这个问题构建现实的评估环境也具有挑战性。如果没有精心设计,合成的长期对话可能产生浅层轨迹或可通过简单新近度启发法解决的查询。因此,有效的评估需要在真实性、可控性和抵抗检索捷径之间取得平衡。 为了解决这些挑战,我们引入了Pragma(PRActical Guidance with Memory Alignment),一个用于评估长期对话中个性化指导的基准。Pragma是通过受控、人类验证的流水线构建的,该流水线生成具有不断变化的用户状态和多样化记忆需求的长期对话历史。该基准包括基于事件级记忆和随时间变化的用户状态的指导场景,包括用户做出与其对话历史相冲突的假设的设置。我们在Pragma上评估了检索系统、结构化记忆系统和长上下文模型。跨架构和生成模型,我们发现当前系统在恢复适当的对话证据以及有效利用其提供个性化指导方面均存在困难。即使检索到了相关证据,模型通常也无法生成连贯且有根据的响应,尤其是在基于轨迹和纠正推理的任务上。我们的研究结果也凸显了支持稳健对话检索和下游记忆基础推理以实现长期个性化协助的记忆架构的必要性。 总而言之,我们的贡献如下: - • 我们引入了Pragma,一个用于评估基于长期对话记忆的个性化指导的基准,重点关注需要对不断变化的用户轨迹和可能错误的用户假设进行推理的指导场景。 - • 我们提出了一种受控、人类验证的基准构建流水线,用于生成具有不断变化的内存依赖性和细粒度证据标注的现实纵向对话。 - • 我们在Pragma上评估了检索系统、记忆系统和长上下文模型,结果表明当前系统难以检索相关记忆并有效利用其提供个性化指导。 ## 2 相关工作 事实记忆回忆基准。最近的基准如LongMemEvalWu et al. (2025) (https://arxiv.org/html/2609.09664#bib.bib9)、LoCoMoMaharana et al. (2024) (https://arxiv.org/html/2609.09664#bib.bib4)和ConvoMemPakhomov et al. (2025) (https://arxiv.org/html/2609.09664#bib.bib10)评估语言模型是否能够通过事实问答、对话理解和记忆基础响应生成等任务,从长对话历史中保留和访问信息。虽然这些基准推动了长上下文记忆和对话一致性的评估,但它们主要集中在恢复或再现过去信息,而不是利用记忆进行开放式实用指导。 个性化对话基准。另一系列工作研究基于用户历史的条件生成。ImplexConvLi et al. (2025b) (https://arxiv.org/html/2609.09664#bib.bib11)评估对语义上遥远的对话证据的隐式推理,但侧重于狭窄的推理设置。PersonaMemJiang et al. (2025) (https://arxiv.org/html/2609.09664#bib.bib12)引入了偏好演变和推荐场景,但依赖于多选题评估而非开放式生成。HiCUPIDMok et al. (2025) (https://arxiv.org/html/2609.09664#bib.bib13)评估基于配置文件的生成,其中用户偏好和配置文件属性明确嵌入在对话历史中,减少了对长期交互进行隐式记忆推理的需求。表1 (https://arxiv.org/html/2609.09664#S1.T1)提供了Pragma与现有个性化记忆和长上下文基准的比较。总体而言,现有基准对基于不断变化的用户轨迹的开放式个性化指导的评估有限。 ## 3 PRAGMA 参见标题 图 2:Pragma基准构建流水线概述。 我们引入Pragma,一个用于评估长期对话中个性化指导的基准。在本节中,我们将描述其构建流水线,包括查询设计、历史生成、证据标注和评估协议。 ### 3.1 查询设计 为了评估现实世界的个性化指导,我们构建了用户信息随时间自然累积的长期对话上下文。在这些设置中,用户在持续的对话中寻求开放式的实用指导,包括推荐、规划支持和决策辅助。然而,长上下文对话中的实用指导带来了几个挑战。相关上下文可能来自孤立事件或出现在长期交互中,而用户请求可能不完整、过时或与先前上下文不一致。这些特征无法通过当前具有受限响应生成设置的事实回忆基准完全捕捉。 为了全面涵盖这些挑战,我们沿两个正交维度组织查询:记忆动态和查询对齐。记忆动态区分了事件级经验(静态)和纵向用户轨迹(演变)。查询对齐描述用户假设是否与先前的对话证据一致。结合这些维度产生四个查询类别(表2 (https://arxiv.org/html/2609.09664#S3.T2)): - Event-Align查询需要基于连贯的事件级经验的指导; - Event-Correct查询需要在提供适当指导前纠正错误的事件级假设; - Traj-Align查询需要对演变的用户轨迹进行推理; - Traj-Correct查询需要识别用户的提议决策与其纵向轨迹冲突,并提供纠正性指导。 每种查询类型的示例查询见附录A.5 (https://arxiv.org/html/2609.09664#A1.SS5)。 | 记忆动态 \ 查询对齐 | 记忆对齐 | 记忆错位 | | :--- | :--- | :--- | | 静态 | Event-Align | Event-Correct | | 演变 | Traj-Align | Traj-Correct | 表 2:Pragma查询分类法。 ### 3.2 基准构建 Pragma是通过一个受控的生成流水线构建的,并经过验证以创建个性化指导查询,同时最小化新近度启发式和词汇匹配等捷径策略。更多构建细节和示例见附录A (https://arxiv.org/html/2609.09664#A1)。 **用户模式设计**。为确保用户角色和纵向行为的多样性,我们首先使用Privasis-ZeroKim et al. (2026) (https://arxiv.org/html/2609.09664#bib.bib14)中的100个合成用户,该库提供了适合生成连贯的角色基础属性和经验的丰富个人资料信息。我们仅提取与可控制生成相关的个人资料信息,包括人口统计属性(例如,年龄、收入水平、母语、公民身份)和用户事件列表。使用gpt-5,我们为每个用户生成:(1) 一句话的角色摘要,(2) 一个基于事件的经验主题,以及(3) 两个基于轨迹演变的潜在行为轴。主题和轴被提示保持角色兼容但相互独立。 **基于事件的查询构建**。对于基于事件的查询,我们首先在一年期间(2025-05-01至2026-04-30)生成与采样主题相关的2-5个带时间戳的用户事件。然后使用这些事件构建两种查询类型,分别对应于对齐和纠正指导设置。 - 事件对齐查询设计为引用主题,提供检索线索,同时仍要求模型解释先前的经验应如何影响推荐。 - 事件纠正查询故意包含从多个先前事件构建的混合或部分错误的回忆。用户不是直接请求事实纠正,而是基于错误前提寻求实用指导,要求模型在生成适当指导前识别用户假设中的不一致。 **基于轨迹的查询构建**。对于基于轨迹的查询,我们生成由两个独立行为轴上4-8个带时间戳状态组成的纵向用户轨迹。我们有意构建跨多个同时演变的行为轴的轨迹。当仅有一个属性发生变化时,任务通常可以简化为...
相似文章
学习用户感知召回:长期对话记忆中的个性化检索
本文介绍了Profile-guided Personalized Retrieval Optimization (PPRO),一种通过将用户画像融入记忆检索并利用强化学习优化检索的框架,增强了长期对话智能体的能力,在现有方法上实现了持续改进。
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
当用户未提问时:对话代理中上下文驱动记忆检索的基准测试
本文介绍了LoCoMo-Conv,一个对话记忆基准,用于评估长期对话代理中使用不同查询风格的记忆检索和响应质量,揭示了现有QA基准中的差距,并建议基于推理的记忆细化作为一个有前景的方向。
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
Introduces FinPerMA, an event-grounded benchmark for evaluating personalized memory in LLM agents for financial advising, showing that current models and memory systems remain far from saturated.