记忆之外:从记住到了解你——基于长期多模态个人档案的视角
摘要
本文介绍了ReaLMem,这是首个使用真实个人档案评估AI长期多模态记忆的基准,并提出了ChronoProfiler,通过时间加权来提升AI伴侣的个性化能力。
arXiv:2609.19167v1 Announce Type: new
摘要:随着AI系统演变为个性化数字伴侣,一个核心能力是对用户长期个人历史的推理:不仅仅是存储过去事件,而是跟踪纵向体验和不断变化的偏好。这里的进展受到评估的瓶颈限制,现有的长期记忆基准大多是合成的且仅限于文本,它们忽略了锚定日常人类记忆的视觉记录,缺乏真正个性化所要求的真实且因果关联的纵向数据,因此仍然局限于浅层事实回忆。我们引入了ReaLMem(真实世界长期多模态记忆),这是首个基于真实多年个人视觉档案构建的基准,配以第一人称主观注释。ReaLMem在三个认知层次上评估模型,难度递增:事实回忆、人格推断和预测性个性化。我们进一步提出了ChronoProfiler,一个时间加权分析模块,它计算用户属性的时间稳定性分数并将其作为显著性先验,解决时间不一致偏好之间的冲突,并帮助模型在复杂个性化决策中整合多个共存偏好。在ReaLMem上对前沿多模态大语言模型(MLLMs)和记忆系统的广泛评估揭示了预测性个性化作为一个一致的上限,暴露了MLLMs与记忆系统之间的明显性能差距和瓶颈,并表明高质量、时间知情的表示显著提高了个性化。总之,ReaLMem和ChronoProfiler提供了一个真实的测试平台和简单有效的长期个性化机制,为未来终身AI伴侣的研究奠定了基础。
查看缓存全文
缓存时间: 2026/09/18 08:53
# 从记忆到认知:基于长期多模态个人档案的深度理解 来源:https://arxiv.org/html/2609.19167 朱睿 | Memories.ai 研究部 文凯奥 | 布里斯托大学 郑昊 | 布里斯托大学 / Memories.ai 研究部 郑欣怡 | 布里斯托大学 吴佩然 | 布里斯托大学 / Memories.ai 研究部 周恩民 | Memories.ai 研究部 吴志豪 沈俊潇 | 布里斯托大学 ###### 摘要 随着AI系统发展为个性化数字伙伴,其核心能力是对用户长期个人历史的推理:不仅是存储过去事件,更要追踪纵向经历与演变中的偏好。当前评估手段的局限已成为主要瓶颈——现有长期记忆基准大多为合成数据且仅限文本,它们忽略了锚定日常记忆的视觉记录,缺乏真实个性化所需的因果连贯纵向数据,因此仍停留在浅层事实回忆层面。我们推出ReaLMem(真实世界长期多模态记忆),这是首个基于真实多年个人视觉档案构建、配有第一人称主观标注的基准数据集。ReaLMem从三个渐进认知层级评估模型:事实回忆、人设推断与预测性个性化。我们进一步提出ChronoProfiler时序加权分析模块,通过计算用户属性的时序稳定度并将其转化为显著性先验,解决时序不一致偏好间的冲突,帮助模型在复杂个性化决策中整合多重活跃偏好。在ReaLMem上对前沿多模态大语言模型与记忆系统的全面评估揭示:预测性个性化始终是性能天花板,多模态大语言模型与记忆系统间存在显著差距,且高质量时序感知表征能显著提升个性化效果。ReaLMem与ChronoProfiler共同提供了真实的测试平台与简洁有效的长期个性化机制,为终身AI伙伴的未来研究奠定基础。 ## 1 引言 随着人工智能向通用人工智能(AGI)演进,人机交互正从单次指令执行转向持续、个性化的数字伙伴。长期记忆是这一转变的基石[22 (https://arxiv.org/html/2609.19167#bib.bib1), 46 (https://arxiv.org/html/2609.19167#bib.bib2)]:它使模型能够积累、追踪并推理用户跨越数年的经历与演变偏好,从孤立的事实问答转向基于个人历史的定制化响应。近期研究已开始构建长上下文、长周期的个人记忆基准[43 (https://arxiv.org/html/2609.19167#bib.bib3), 29 (https://arxiv.org/html/2609.19167#bib.bib4), 39 (https://arxiv.org/html/2609.19167#bib.bib29)]。然而,当前评估体系的两项缺陷阻碍了真正个性化长期助手的进展——数据与任务设计存在局限。 图1:ReaLMem概述:(左)跨越数年的个人多模态记忆流示例;(右)基于该记忆的三层任务金字塔,认知复杂度从第1层事实记忆回忆、第2层人设推断逐级上升至第3层预测性个性化,九项子任务均附带定义与查询示例。 首先,现有基准大多缺乏真实性且忽视视觉维度。受隐私与成本限制,它们主要通过大语言模型(LLM)[48 (https://arxiv.org/html/2609.19167#bib.bib6), 7 (https://arxiv.org/html/2609.19167#bib.bib5), 18 (https://arxiv.org/html/2609.19167#bib.bib7), 19 (https://arxiv.org/html/2609.19167#bib.bib8)]自上而下合成纯文本数据,或通过机械插入无关段落(如“大海捞针”式填充)[14 (https://arxiv.org/html/2609.19167#bib.bib18), 36 (https://arxiv.org/html/2609.19167#bib.bib26)]扩展上下文。这种合成方式破坏了记忆的自然时序与因果结构,且难以捕捉真实人类体验的复杂性。更根本的是,它忽视了视觉记录——这些锚定日常记忆的照片与视频[2 (https://arxiv.org/html/2609.19167#bib.bib31)],导致评估与物理世界脱节。 其次,作为直接结果,评估止步于浅层事实回忆。由于合成语料缺乏现实生活中积累的真实、因果连贯的纵向数据,它们无法支持真正个性化所需的深层能力。人类偏好具有动态性与情境依赖性,受情境与情感交互影响;因此评估个性化助手需要超越检索,转向理解偏好如何演变、推理其变化原因并预测未来选择。 这些局限引发两个问题:(a)何种数据能支撑真实长期个性化的评估;(b)应如何设计任务以全面评估理解人类个性化的能力? 自我中心视觉与生活日志视觉[10 (https://arxiv.org/html/2609.19167#bib.bib32), 6 (https://arxiv.org/html/2609.19167#bib.bib49), 4 (https://arxiv.org/html/2609.19167#bib.bib33)]已开始直接研究个人视觉数据,但主要聚焦短期感知与检索,且通常缺乏数据所有者的第一人称主观标注——这两大缺口限制了个性化发展。我们认为,人们设备中已存储的个人媒体档案——特别是照片与视频——是长期多模态记忆的天然强大载体:它们跨越数年,记录用户足迹、行为与关切,保留了纯文本日志舍弃的视觉与情境锚点。若视为长期记忆并配以所有者自身视角,这些档案能开创一条路径,打造基于视觉记忆提供主动、情境感知、个性化帮助的助手。 基于以上洞察,我们突破合成数据范式,推出ReaLMem——首个源自真实个人视觉档案并配有第一人称主观标注的多模态长期记忆基准数据集。为结构化评估,我们借鉴布鲁姆教育目标分类法[1 (https://arxiv.org/html/2609.19167#bib.bib24)],将任务组织为三个渐进难度的认知层级(图1 [https://arxiv.org/html/2609.19167#S1.F1]):从事实回忆、人设推断,到用户历史预测性个性化。 此规模的真实个性化还面临具体架构障碍:将超长多模态历史输入模型计算成本高昂且易受“中间遗失效应”[28 (https://arxiv.org/html/2609.19167#bib.bib17)]影响,而现有方法扁平化历史偏好[38 (https://arxiv.org/html/2609.19167#bib.bib20), 42 (https://arxiv.org/html/2609.19167#bib.bib30)],将一次性提及与长期习惯等同处理,无法仲裁偏好冲突或竞争。作为针对性方案,我们提出ChronoProfiler——即插即用的用户分析模块,从纵向历史逐步提炼结构化人设,并为每条记录分配时序稳定度分数。该分数作为显著性先验,可解决时序冲突,帮助模型在复杂个性化决策中权衡并整合多重活跃偏好。 综上,我们的贡献如下: ∙ 我们推出ReaLMem——首个基于真实个人视觉档案与第一人称主观标注构建的多模态长期记忆基准,包含2508个跨越六年的多模态会话,具备真实时空元数据。 ∙ 我们设计三层认知评估体系——事实记忆回忆、人设推断与预测性个性化,通过1629个问答对实例化,实现个性化细粒度评估。 ∙ 我们提出ChronoProfiler——时序感知用户分析模块,将时序稳定度分数转化为偏好加权个性化任务的显著性先验。 ∙ 我们在ReaLMem上全面评估多模态大语言模型与记忆系统,揭示性能差距、模态依赖性与未解挑战。 ## 2 相关工作 ### 2.1 个人记忆基准 近期个人记忆基准[48 (https://arxiv.org/html/2609.19167#bib.bib6), 45 (https://arxiv.org/html/2609.19167#bib.bib21), 17 (https://arxiv.org/html/2609.19167#bib.bib27), 24 (https://arxiv.org/html/2609.19167#bib.bib28)]从三条互补路径应对长期记忆挑战。第一条路径通过因果时序事件图生成多会话多模态对话,扩展模态与来源覆盖[29 (https://arxiv.org/html/2609.19167#bib.bib4)]。第二条路径将用户偏好隐式嵌入对话上下文,测试对碎片化偶发信号的演绎推理[7 (https://arxiv.org/html/2609.19167#bib.bib5), 18 (https://arxiv.org/html/2609.19167#bib.bib7), 19 (https://arxiv.org/html/2609.19167#bib.bib8)]。第三条路径通过“大海捞针”构造扩展上下文长度,在海量干扰对话中注入关键证据[43 (https://arxiv.org/html/2609.19167#bib.bib3)],上下文规模达150万标记。 尽管取得进展,这些基准因合成来源共享三项结构性局限:(i)模态狭隘性/视觉盲区:多数评估数据为纯文本,日常记忆锚点的视觉信号未被充分探索。(ii)密度损失与结构扁平化:人设模板与时间图通过LLM合成实现时,抹除了生活体验的模态线索、因果连续性与自然时序对齐,生成的对话缺乏真实情境细微性与不可预测性。(iii)认知深度有限:因此评估多局限于事实检索,难以为多偏好整合或现实约束下的动态冲突解决提供深层推理空间。 为弥合差距,我们将评估建立在真实长期多模态个人数据而非合成基底之上。基于参与者真实纵向日常记录——其中每刻都承载隐含的个人情境——我们推出首个由真实多模态个人历史构建的基准,并配套三层任务体系,严格评估事实回忆、偏好行为推断与复杂预测性个性化。 ### 2.2 自我中心视觉与生活日志视觉 部分研究直接聚焦个人视觉数据。自我中心视频理解构建大规模第一人称数据集用于活动与交互识别[10 (https://arxiv.org/html/2609.19167#bib.bib32), 4 (https://arxiv.org/html/2609.19167#bib.bib33), 11 (https://arxiv.org/html/2609.19167#bib.bib39)],生活日志检索则组织检索可穿戴相机或个人照片流[12 (https://arxiv.org/html/2609.19167#bib.bib34), 13 (https://arxiv.org/html/2609.19167#bib.bib35)]。近期工作向更长周期与助手式应用推进——超长自我中心视频理解[49 (https://arxiv.org/html/2609.19167#bib.bib48)]与自我中心生活助手[6 (https://arxiv.org/html/2609.19167#bib.bib49)],其中最接近我们场景的OmniQuery[25 (https://arxiv.org/html/2609.19167#bib.bib19)]能基于捕获的多模态记忆回答个人问题。 然而这些工作大多处理数小时至数天的连续自我中心视频,依赖第三人称或任务标签而非数据所有者的主观标注,且未达到我们任务所需的人设推断与预测性个性化层级。ReaLMem将此脉络从感知推向长期个性化认知,通过多年个人视觉档案与第一人称标注配对,结合分级认知层级评估实现突破。 图2:ReaLMem构建流程:原始个人照片视频经所有者标注(客观与主观层)、匿名化处理,并编织成时序多模态会话。 ### 2.3 大语言模型记忆机制 赋予大语言模型长期记忆的研究沿两条互补路径展开。第一条通过更长上下文窗口或检索增强生成(RAG)[23 (https://arxiv.org/html/2609.19167#bib.bib14), 41 (https://arxiv.org/html/2609.19167#bib.bib15), 44 (https://arxiv.org/html/2609.19167#bib.bib16)]扩展历史原始访问,在查询时检索语义相似的历史片段。第二条引入结构化记忆架构,将个人历史组织为可复用表征,包括知识图谱记忆[3 (https://arxiv.org/html/2609.19167#bib.bib13), 35 (https://arxiv.org/html/2609.19167#bib.bib12)]、层级记忆树[26 (https://arxiv.org/html/2609.19167#bib.bib9)]及操作系统式记忆框架,将记忆作为生命周期管理资源[27 (https://arxiv.org/html/2609.19167#bib.bib10), 15 (https://arxiv.org/html/2609.19167#bib.bib11)]。 尽管有这些进展,现有系统共享两项与长周期个性化直接相关的局限:(i)偏好扁平化:检索与存储将所有历史信号视为同等有效,缺乏区分长期习惯与一次性提及的原则机制,模型需自行仲裁竞争偏好。(ii)时序感知薄弱:时间戳即使存在也多作为检索过滤器而非内容的一阶先验,导致推理时新旧记录冲突未解决。这些缺口限制了在需要综合异质时变信号形成连贯个性化决策的任务上的可靠表现。 对此,ChronoProfiler构建用户画像,其中每条记录以带时间戳证据为基底,根据时序特征获得时序稳定度分数作为显著性先验,使记忆系统能解决时序冲突、优先处理稳定偏好,且无需修改底层大语言模型。 ## 3 ReaLMem 我们推出ReaLMem(真实世界长期多模态记忆)。与先前基于预定义合成人设的基准不同,ReaLMem源自真实个人视觉档案——跨越数年真实生活的照片与视频——配以数据所有者的第一人称主观标注。这种扎根于真实多模态体验与所有者自身视角的设计,为研究记忆留存、偏好演变与个性化协助提供了严谨基础。下文详述数据集构建与任务设计。 ### 3.1 数据集构建 我们通过以参与者为中心的流程构建ReaLMem,将原始个人视觉档案转化为结构化、高保真多模态记忆序列(图2 [https://arxiv.org/html/2609.19167#S2.F2])。我们招募了7名
相似文章
从回想到遗忘:为个性化智能体评估长期记忆
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
在长期用户交互中个性化具身多模态大语言模型智能体
本文提出Polar,一种多模态记忆增强框架,用于在长期用户交互中个性化具身MLLM智能体,利用知识图谱和情景记忆从累积上下文中定位用户意图的实例。
MemArena:一种面向大规模设备端智能个人记忆助手的自我中心基准
MemArena 是一种新的自我中心基准,用于评估设备端个人记忆助手,它使用 MASim 智能体模拟器生成多会话对话世界,并在回忆、推理和可信度维度上提供真值。初步结果表明,记忆后端的选择通常比读取器规模更重要,而基于权限的访问仍然是一个普遍挑战。
MemoryForge:为类人LLM智能体合成终身记忆
本文介绍了MemoryForge,一个从简短目标人设中合成终身自传体记忆的框架,使冻结的LLM能够在角色扮演和用户模拟中表现出更类人的行为,优于描述性条件化基线。