Setoka:面向异构数据的个性化智能体分层用户理解基准
摘要
Setoka是一个基准,用于评估记忆增强的个性化智能体从异构数据中分层理解用户(语义记忆、情景记忆、行为模式、人格特质)的能力,揭示了当前记忆系统在需要跨来源整合和抽象的任务上存在困难。
arXiv:2607.27056v1 公告类型:新
摘要:个性化智能体越来越多地被应用于协助用户完成各种任务。有效的个性化协助不仅需要从智能体记忆中存储的过往交互中检索明确的事实,还需要推断抽象的个人特征。然而,现有记忆基准主要评估智能体能否检索对话历史中明确陈述的信息,未能对更深层的用户理解提供有效评估。在这项工作中,我们提出了Setoka,一个用于从异构数据中评估具有分层用户理解的记忆增强个性化智能体的基准。基于认知心理学和人格心理学的理论,Setoka定义了四个层次的用户理解,即语义记忆、情景记忆、行为模式和人格特质。此外,为了实现现实且保护隐私的评估,我们设计了一条基于心理测量学的流程,能够大规模合成多样、连贯的异构用户数据和查询。最后,我们利用Setoka对3个语言模型结合5个记忆系统在10个合成用户上进行了评估。我们的综合评估显示,虽然现有系统在语义记忆检索上表现良好,但其在情景记忆上的表现有所下降。此外,在处理需要整合随时间分散的异构和碎片化信息的行为模式与人格特质理解任务时,性能进一步下降。这些发现表明,用户理解无法通过简单的事实检索来处理,这促使我们设计用于跨来源整合和长期用户行为抽象的记忆机制。
查看缓存全文
缓存时间: 2026/07/31 04:01
# Setoka: 面向异构数据上个性化代理的分层用户理解基准 来源:https://arxiv.org/html/2607.27056 Lingyang Zeng1, Guangze Chen1, Kaichen Yu1, Zhicheng Pan2, Siyang Weng1, Zirui Hu1, Xiangyun Du1, Hailin He1, Rong Zhang1, Chengcheng Yang1, Kai Huang1, Xuan Zhou1 ###### 摘要 个性化代理正越来越多地被应用于辅助用户完成各种任务。有效的个性化辅助不仅需要从代理记忆中存储的过往交互中检索明确事实,还需要推断抽象的个人特征。然而,现有的记忆基准主要评估代理能否检索对话历史中明确陈述的信息,未能对更深层次的用户理解提供有效评估。在本工作中,我们提出 Setoka,一个用于从异构数据评估具有分层用户理解的记忆增强型个性化代理的基准。基于认知心理学和人格心理学的理论,Setoka 定义了用户理解的四个层次,即语义记忆、情景记忆、行为模式和人格特质。此外,为了实现既真实又保护隐私的评估,我们设计了一个基于心理测量学的流水线,能够规模化地合成多样且连贯的异构用户数据和查询。最后,我们利用 Setoka 对 3 种语言模型结合 5 种记忆系统在 10 个合成用户上进行了评估。我们的综合评估显示,现有系统在语义记忆检索上表现良好,但在情景记忆上性能下降。此外,在处理行为模式和人格特质理解任务时,由于这些任务需要整合分散在时间上的异构且碎片化的信息,性能进一步下降。这些发现表明,用户理解无法通过简单的事实检索来实现,从而促使记忆机制设计需要支持跨来源整合和对长期用户行为的抽象。 ## 1 引言 基于大语言模型(LLM)的代理正越来越多地被部署为个性化助手 (Li et al.2024 (https://arxiv.org/html/2607.27056#bib.bib16)),能够理解用户指令并自主执行。这类代理的巨大优势在于它们能够处理不同用户理解程度的任务。通常,有些任务仅需检索一个明确事实(例如,预定的会议时间),而更复杂的任务则需要细致的理解,以捕捉用户的行为模式和人格特质。然而,这些抽象特征很少被明确陈述。相反,它们分散在异构数据源中,包括非结构化文本(如消息和笔记)、结构化记录(如联系人和日历)以及图(如社交关系) (Hu et al.2026 (https://arxiv.org/html/2607.27056#bib.bib11))。例如,人格特质“外向性”无法仅从单一来源推断出来。它需要综合考量日历中频繁的群体活动、群聊中的积极参与以及社交图中的大量关联。这种分散性使得直接的基于检索的方法效果不佳,因为没有任何单一数据源能够提供对用户的全面理解。 近年来,面向代理的记忆系统快速发展 (Chhikara et al.2025 (https://arxiv.org/html/2607.27056#bib.bib2))。面向记忆增强型代理的基准作为衡量这些进展的关键试金石,能够揭示潜在局限性并指导更强大记忆系统的开发。然而,现有基准 (Maharana et al.2024 (https://arxiv.org/html/2607.27056#bib.bib18); Wu et al.2025a (https://arxiv.org/html/2607.27056#bib.bib31); Du et al.2024 (https://arxiv.org/html/2607.27056#bib.bib5); Tan et al.2025 (https://arxiv.org/html/2607.27056#bib.bib26); Jiang et al.2025a (https://arxiv.org/html/2607.27056#bib.bib13),b (https://arxiv.org/html/2607.27056#bib.bib14); Wu et al.2026 (https://arxiv.org/html/2607.27056#bib.bib32)) 主要评估对话历史中明确陈述事实的检索准确性。因此,它们无法充分揭示记忆系统能否跨异构数据源整合隐性证据来推断抽象的个人特征。 然而,构建这样一个基准并非易事,主要原因有两个。首先,从真实用户收集异构数据会引发隐私问题,而且获取系统性评估所需规模的数据成本也过高。其次,评估深层用户理解需要将答案立足于连贯的用户画像,即高层特质需要由底层记录来支撑。为清晰起见,具体挑战总结如下。 **分层用户理解(C1)。** 用户理解需要内在不同的推理操作,从检索明确事实到推断人格特质。构建这样一个层次结构并非易事,因为它既需要不同的推理范围,又需要从具体记录无缝过渡到抽象特征。 **真实人物画像采样(C2)。** 一个真实的人物画像应当类似于一个连贯的个体,而不是人格特质的随机组合。在真实人群中,人格特质并非孤立存在。也就是说,某些特质组合是常见的,而另一些则很少被观察到。直接提示 LLM 构建人物画像或分别对每个人格特质进行采样,可能会产生在现实中不太可能出现的特质组合。 **多样的特质-行为映射(C3)。** 同一种人格特质在不同事件类别中可能产生多样的行为模式。然而,现有依赖人物画像条件化 LLM 生成的数据合成方法,可能将人格特质画像映射到一组狭窄的刻板行为上 (Cheng, Durmus, and Jurafsky2023 (https://arxiv.org/html/2607.27056#bib.bib1); Liu, Diab, and Fried2024 (https://arxiv.org/html/2607.27056#bib.bib17)),忽略了人格心理学中记载的个体间多样性。 **可扩展且一致的生成(C4)。** 将行为模式映射到长期的异构用户数据中会引入两个相互关联的问题。首先,仅基于 LLM 的生成难以扩展到长历史,因为随着上下文增长,早期的行为约束可能被遗忘或违反。其次,独立生成异构记录可能会在描述同一底层事件的数据项之间引入矛盾。 为应对这些挑战,我们提出 Setoka,一个专用基准,用于全面评估面向个性化任务型代理的分层用户理解。具体而言,为应对 C1,我们提出了一个*基于认知心理学和人格心理学的四层用户理解框架*,包括语义记忆(SM)、情景记忆(EM)、行为模式(BP)和人格特质(PT)。这四个层次跨越了从具体个人记忆到抽象个人特征的连续体。为应对 C2,我们提出了*相关性感知的人格特质采样*策略。即,人格特质从多元高斯分布中联合采样,其协方差矩阵源自元分析心理测量学相关性。通过保留人格维度间经验观察到的相关性,这种方法能够产生更连贯且具有心理学依据的人格特质画像。为应对 C3,我们提出了*心理量表引导的行为模式生成*。采样得到的人格特质通过经过验证的心理量表 (Soto and John2017 (https://arxiv.org/html/2607.27056#bib.bib24)) 映射到行为模式,这些量表提供了基于既有心理学构念的细粒度行为模式,而非仅依赖 LLM 生成。为应对 C4,我们提出了*事件接地生成树*,将行为模式和上下文组织为具体事件。在每个父节点下,子事件按顺序生成,每个子事件以其前面的兄弟事件为条件。然后,它们的细节被并行独立扩展,而无需保留完整事件历史。所有异构记录都源自其底层事件,以保持跨记录一致性。 总之,我们做出了以下贡献: - •我们指出现有基准的一个根本局限:它们未能充分评估个性化代理所需的多个层次的用户理解。 - •据我们所知,我们引入了第一个基于心理学框架的分层用户理解评估,涵盖具体个人记忆和抽象个人特征。通过明确定义每个层次所需的证据范围和推理操作,该框架使得不同层次的用户理解能够被独立评估。 - •我们开发了一个基于心理测量学的生成流水线,能够采样连贯的用户画像,并从中规模化地生成长时程的异构记录。这一设计不仅为具体个人记忆提供了参考答案,还为抽象个人特征提供了参考答案,从而支持带有可追溯证据的分层特定查询。 - •我们以 10 个合成用户画像和跨 3 种数据模型的 23 个模式实例化了 Setoka。然后,我们对 3 种语言模型搭配 5 种主流记忆系统进行了综合评估。结果表明,简单的事实检索是不够的,这促使记忆机制应当整合跨来源证据并抽象长期用户行为。 ## 2 相关工作 | 基准 | 记忆来源 | 语义记忆 | 情景记忆 | 行为模式 | 人格特质 | #数据模型 | #模式 | |---|---|---|---|---|---|---|---| | LoCoMo (Maharana et al.2024 (https://arxiv.org/html/2607.27056#bib.bib18)) | 对话 | ✓ | ✓ | × | × | 1 | 1 | | LongMemEval (Wu et al.2025a (https://arxiv.org/html/2607.27056#bib.bib31)) | 对话 | ✓ | ✓ | × | × | 1 | 1 | | PerLTQA (Du et al.2024 (https://arxiv.org/html/2607.27056#bib.bib5)) | 画像、事件、对话 | ✓ | ✓ | × | × | 1 | 4 | | MemBench (Tan et al.2025 (https://arxiv.org/html/2607.27056#bib.bib26)) | 对话 | ✓ | × | × | × | 1 | 1 | | PersonaMem (Jiang et al.2025a (https://arxiv.org/html/2607.27056#bib.bib13)) | 对话 | ✓ | × | × | × | 1 | 1 | | PersonaMem-v2 (Jiang et al.2025b (https://arxiv.org/html/2607.27056#bib.bib14)) | 对话 | ✓ | × | × | × | 1 | 1 | | KnowMe-Bench (Wu et al.2026 (https://arxiv.org/html/2607.27056#bib.bib32)) | 自传体叙事 | ✓ | ✓ | × | × | 1 | 1 | | Setoka | 异构数据 | ✓ | ✓ | ✓ | ✓ | 3 | 23 | 表 1:Setoka 与代表性个性化记忆基准的比较。#数据模型 表示暴露给代理的数据模型数量,#模式 表示不同数据模式的数量;计数大于 1 表示存在异构数据。自然语言中明确陈述的行为模式或人格特质(如“我通常在周末远足”)被归类为 SM,因为它们可以直接检索而无需从底层用户数据中推断。表示部分覆盖。 ### 2.1 记忆系统 作为个性化助手,代理应当能够从过往交互历史中回忆用户特定上下文 (Li et al.2024 (https://arxiv.org/html/2607.27056#bib.bib16); Hu et al.2026 (https://arxiv.org/html/2607.27056#bib.bib11))。近期的记忆增强型代理采用了多种机制来在上下文窗口之外保留和使用信息。MemGPT (Packer et al.2023 (https://arxiv.org/html/2607.27056#bib.bib22)) 通过在工作记忆和外部存储之间移动信息来管理有限的上下文。Mem0 (Chhikara et al.2025 (https://arxiv.org/html/2607.27056#bib.bib2)) 将对话压缩为紧凑、可编辑的用户事实存储,并在新信息到来时修订或移除旧事实。Cognee 和 HippoRAG 2 (Markovic et al.2025 (https://arxiv.org/html/2607.27056#bib.bib19); Gutiérrez et al.2025 (https://arxiv.org/html/2607.27056#bib.bib9)) 以图结构组织记忆,以支持关系性和多跳检索。MemMachine (Wang et al.2026 (https://arxiv.org/html/2607.27056#bib.bib30)) 检索匹配的记忆以及时间上相邻的记忆,提供更完整的上下文。然而,记忆增强型个性化代理仍远未实现深入理解用户,因此全面评估对于进一步进展至关重要。Setoka 通过提供一个统一的基准来评估异构数据上的分层用户理解,填补了这一关键空白。 ### 2.2 记忆基准 现有记忆基准主要评估模型能否从对话历史或文本用户画像记录中保留信息。具体而言,LongMemEval 和 LoCoMo 将记忆定义为对长对话历史中事实的保留和推理 (Wu et al.2025a (https://arxiv.org/html/2607.27056#bib.bib31); Maharana et al.2024 (https://arxiv.org/html/2607.27056#bib.bib18))。PersonaMem 评估模型能否从多会话历史中推断不断演变的用户画像,并选择与用户当前状态一致的响应 (Jiang et al.2025a (https://arxiv.org/html/2607.27056#bib.bib13))。PerLTQA 专注于对语义和情景个人记忆的问答,包括画像、社会关系、事件和对话,以 JSON 数据模型表示 (Du et al.2024 (https://arxiv.org/html/2607.27056#bib.bib5))。 更近期的基准已超越明确陈述的事实。具体而言,MemBench 引入了反思性记忆,要求模型综合交互历史以推断用户的偏好和情绪 (Tan et al.2025 (https://arxiv.org/html/2607.27056#bib.bib26))。PersonaMem-v2 要求从对话的细微差别中推断隐性展现的偏好 (Jiang et al.2025b (https://arxiv.org/html/2607.27056#bib.bib14))。KnowMe-Bench 定义了从事实回忆到原则级推理的多个层次的人物理解,基于长篇自传体叙事进行评估 (Wu et al.2026 (https://arxiv.org/html/2607.27056#bib.bib32))。总体而言,这些基准主要评估在单一同质交互流上的有限用户理解能力。表 1 (https://arxiv.org/html/2607.27056#S2.T1) 总结了 Setoka 与当前记忆基准的区别:它是唯一一个评估代理跨异构数据模型而非单一对话或画像来源的用户理解能力的基准,也是唯一一个覆盖全部四个理解层次的评估套件。 ## 3 用户理解建模 图 1:Setoka 概览。左:Setoka 生成从抽象人格特质到具体语义记忆的用户画像,支持四个层次的用户理解。这些画像随后被用于生成异构用户数据和每个层次的查询。右:每个层次的代表性问题。随着用户理解层次的增加,回答相应问题需要整合更广泛的用户数据证据。下:生成的异构记录被序列化,并由被评估的记忆系统使用以构建其记忆。为了回答用户查询,代理从记忆中检索相关信息,并利用这些信息生成响应。 图 2:Setoka 的基于心理测量学的数据生成流水线。(a) *相关性感知的人格特质采样*从由元分析特质相关性参数化的高斯模型中联合抽取大五人格向量。(b) *基于心理量表的行为模式生成*将每个人格向量转化为一个经过验证的量表(BFI-2)上的项目级响应,从而产生行为模式。
相似文章
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试
PersonaTrail 是一个用于个性化网络代理的基准测试,它利用真实的浏览轨迹来评估代理推断用户偏好和回忆过去信息的能力。该论文还提出了 PACMem,一个在两项任务上都优于现有基线方法的内存框架。
SMMBench:面向源分布的多模态智能体记忆基准测试
提出SMMBench,一个用于评估多模态智能体从独立来源(如对话、表格和文档)中检索、对齐和组合分散证据能力的基准。实验表明,当前系统在此类源分布记忆组合任务上仍存在困难。
SubtleMemory:面向长期AI代理的细粒度关系记忆辨别基准
SubtleMemory是一个用于评估AI代理在长期交互中细粒度关系记忆辨别能力的基准,包含10个长历史中的1,522个实例。它揭示了当前记忆系统在保存和利用细微记忆关系方面的局限性。