参数化多模态用户记忆:存储文字描述无法传达的信息
摘要
本文介绍了一种参数化多模态用户记忆系统,通过整合语音和外貌等感知数据,利用视觉语言模型和专用编码器,提升AI智能体回忆用户的能力,从而超越基于文本的方法。
arXiv:2608.28609v1 公告类型:新
摘要:个性化智能体需要用户记忆:一个关于用户是谁的持久模型。目前它几乎总是文本——通过相似性检索的转录和标题。这适用于人的可描述部分(例如“我的猫叫Bibi”),但丢弃了无法用标题捕捉的感知部分:声音听起来如何,面容在不同年龄和光照下如何变化,声音听起来多么疲惫。我们跨五种模态测量了这种损失:一个强大的基于标题的重新识别器仅能恢复专用编码器0.11的召回率,在非可命名信号上接近随机水平。
相反,我们将感知记忆建立在模型中,将回忆分解为两个子问题:一个视觉语言模型将指代对象置于上下文中(什么和在哪里),而一个专用编码器提取身份密钥(谁),存储为一个内联标记,在生成时通过注意力读取,无需外部往返。单独使用都不足够——VLM在跨年龄人脸识别中仅达到0.54的召回率,而人脸编码器达到0.81,一个无上下文的编码器在双人场景指代中仅识别0.05——但结合它们可达到正确区域预言(0.96),并泛化到多说话者音频和视频。识别核心无需训练:它以O(1)的注册成本在任何冻结模型上再现编码器的召回率。在PerceptMem(12个领域,1,080个任务)上,感知身份受限于容量,而精确事实受限于绑定:身份应属于参数库,事实应属于文本存储。两种记忆可以干净地组合:一个兼有两者的智能体不仅能记住用户说了什么,还能记住他们的样子。
查看缓存全文
缓存时间: 2026/09/01 11:50
# 存储字幕无法承载的信息 来源:https://arxiv.org/html/2608.28609 ## 参数化多模态用户记忆:存储字幕无法承载的内容 ###### 摘要 个性化智能体需要*用户记忆*:一个关于其用户的持久模型。目前,它几乎总是*文本*——通过相似性检索的转录和字幕。这能涵盖一个人的*可描述*部分(“我的猫叫比比”),却丢弃了字幕无法承载的*感知*部分:声音听起来如何,面孔在年龄和光照变化下如何被解读,一个人听起来有多疲惫。我们衡量了这种信息损失在五种模态上的表现:一个基于字幕的强重识别系统仅能恢复专用编码器召回率的0\.11,对于不可命名的信号,其表现接近随机。我们将感知记忆植根于模型中,将召回分解为两个子问题:视觉-语言模型在上下文中定位指代对象(*是什么*和*在哪里*),而专用编码器提取身份*密钥*(*是谁*),将其存储为一个内联标记,在生成时通过注意力机制读取,无需外部往返。两者单独都不够——视觉-语言模型仅能以0\.54的召回率识别跨年龄面孔,而人脸编码器可达0\.81,一个未经定位的编码器识别两人场景中指代对象的召回率仅为0\.05——但两者结合能达到正确区域的理论上限(0\.96),并能泛化到多说话人音频和视频中。识别核心是*无需训练*的:它能在任何冻结模型上以O(1)的注册成本复现编码器的召回率。在PerceptMem(12个领域,1080个任务)上,感知身份受容量限制(召回率≈min(1,k/M),受限于编码器的上限),而精确事实则受绑定限制:身份应属于参数化库,事实则存于文本存储中。两者可以整洁地组合:一个同时拥有两者的智能体不仅能记住用户说过什么,还能记住他们的样子。 ## 1 引言 参见图1说明:视觉-语言模型在杂乱场景中定位用户所指的指代对象(*是什么*/*在哪里*);专用编码器将定位后的区域转换为身份密钥(*是谁*);AttMem将该密钥存储在冻结的语言模型中,作为单个内联标记读回。任何单独组件都不足——视觉-语言模型是弱身份编码器,而裸编码器无法从场景中选出指代对象;结合后,它们达到了正确区域的理论上限(图2)。该机制在图4中详述。当AI智能体“记住”其服务对象的某些信息时,它实际存储了什么?在当今几乎每个系统中,答案都是*文本*。主流的对话记忆架构——Mem0、MemoryLLM、MemGPT / Letta、M3-Agent以及LongMemEval中综述的相关工作——都将智能体看到或听到的内容转换为转录(通过ASR)和字幕(通过BLIP-2或LLaVA等模型)。这些片段存储在句子编码器向量索引中,后续通过相似性检索。类似地,个性化视觉-语言系统也依赖于文本主干:一个*命名*概念(例如“比比”)作为句柄,而底层感知仍是次要的。这种策略适用于一个人的*可描述*部分——诸如“我的猫叫比比”、“我是素食者”这类信息能完整地通过文本传递。然而,对于其余部分则不足:声音听起来如何,或面孔在年龄和光照变化下如何被解读,无法仅靠文本捕获。“棕色头发的男人”的描述无法区分两个棕色头发的男人。此外,来自强字幕系统的重识别记录仅能恢复专用编码器召回率的0\.11的感知身份——损失是信道特性,而非措辞问题。当前系统忽视了这*感知*的一半:它被扁平化为字幕并丢失,或交给识别器返回类似“说话者47”的裸标签,而模型从未见过。缺失的是一种将感知*作为感知*存储的记忆。 #### 我们的提案:植根化、参数化、多模态用户记忆。 我们以原生模态保存每一种感知,并将记忆过程分解为三个步骤:视觉-语言模型*定位*用户所指的指代对象(*是什么*和*在哪里*)。定位是在编码前分离指代对象的行为。专用编码器(ArcFace、ECAPA-TDNN、CLIP)将定位后的区域转换为身份*密钥*(*是谁*);AttMem是冻结语言模型上的一个小型每模态记忆库,存储该密钥,并在输出头通过注意力机制作为单个标记标记读回。召回因此成为一个模型所依赖的标记——在生成过程中产生,无需字幕和检索往返,通过单次O(1)的张量追加注册,无需针对用户进行训练。AttMem借鉴了kNN-LM和Memorizing Transformers的库上注意力模式,但目标不同:一个用户持久的感知身份。 #### 为何定位必不可少。 感知记忆不能简单地编码智能体观察到的任何内容,因为原始感知混合了值得记忆的身份和周围的上下文。同一朋友在咖啡店和冲浪时拍摄的照片几乎没有共同的像素,因此整幅图像的嵌入会将它们置于远距离。然而,我们通过*聚焦于面部*并丢弃背景,一眼就能认出是同一个人。同样的原理也适用于音频:电话通话中的声音和播客中的声音在词汇和声学上差异很大,但听者仍能可靠地识别说话者。这就产生了分工:视觉-语言模型识别*关注哪个*区域,但作为身份编码器较弱,而专家编码器产生条件不变的表示,但无法在杂乱场景中定位指代对象。定位让每个组件弥补对方的盲点,实现两者单独无法达到的识别。 参见图2说明:任何单独组件都不工作;定位弥补了双方的盲点。两个针对性实验分离了每个组件的失败情况。*左(身份)*:在AgeDB跨年龄人脸(N=20)上,视觉-语言模型的视觉标记是弱身份编码器(召回率0\.54),而专用人脸编码器达到0\.81的召回率。*右(定位)*:在两人场景(K=2)中,裸编码器嵌入整个场景的性能接近随机(0\.05),而先定位指代对象则能达到近乎完美的性能(0\.96)。这种分工至关重要:视觉-语言模型擅长定位,但在身份不变性上挣扎,而专家编码器具有高度不变性,但无法定位目标。详细的消融研究见图7。图3对比了两种方法在“记住她”任务上的表现。 参见图3说明:一个具体例子。在群组照片中,给定“记住她”的指令,字幕式记忆存储了一个能匹配数千人的通用描述,导致近乎随机的重识别性能。我们的植根式记忆则存储单个内联标记,支持跨不同条件对正确人物的准确召回。所示数字是配对重识别准确率(第5节)。 #### 贡献。 - •感知用户记忆必须植根化,而非字幕化。我们论证并实证表明,文本从根本上不足以处理感知用户内容。有效的召回需要分解为视觉-语言模型定位、专家编码和模型内存储(第1–3节)。 - •在上下文中恢复理论上限识别的植根化记忆。通过结合用于指代对象定位的视觉-语言模型、用于身份提取的专家编码器以及用于存储的内联注意力标记,我们的方法在杂乱场景中达到了接近理论上限的准确率——在这些场景中,整场景编码接近随机。这在视觉、音频和视频中均成立(第5节)。 - •无需训练、O(1)的模型内识别核心。我们的记忆通过输出头的注意力读取,*零*梯度更新。它在十个冻结模型家族上复现了专家编码器的性能,具有恒定时间的插入和召回。这比在上下文中保留原始感知要便宜得多(第3–5节)。 - •PerceptMem基准测试和容量律路由器。我们介绍了PerceptMem,一个涵盖12个感知领域和五种模态下1080个任务的基准测试。基准测试包括纯文本和随机机会基线。此外,我们提出了两种容量律,将感知身份路由到参数化库,将事实知识路由到文本存储(第4、8节)。 ## 2 分解感知召回:定位与识别 为何基于文本的路径如此一致地失败?问题不在于努力不足,而在于根本性的结构限制。考虑语音识别中最具挑战性的情况:智能体存档了十份语音样本,而一份新录音来自不同的房间、不同的日子、不同的声学环境。它必须确定这十个说话者中哪一个与之匹配。智能体有四种选择。其中三种丢弃了区分不同声音的原始感知信号。只有第四条路径保留了此信号——然而,这样做立即揭示了一个更深层次的问题:每种方法都隐含地混淆了两个不同的子问题。识别一种感知需要(1)在杂乱上下文中定位指代对象,以及(2)编码其身份。没有单一组件能很好地同时完成这两项任务。 表1:记忆感知的四条路径,加上我们的方法(文中引用)。只有保留原始感知的路径才能跨条件进行区分。只有嵌入检索和我们的方法继承了编码器的召回率;我们的方法还通过视觉-语言模型定位指代对象,并*在模型内*将身份读回为模型所依赖的标记,这无需训练且为O(1)。 丢弃信号的三条路径。 *字幕与搜索*:将声音记录下来(“男性声音,30多岁,略带东欧口音”),随后基于词语进行相似性检索。虽然描述真实,但过于通用:它能匹配数千个说话者,因此基于字幕的余弦相似性甚至无法可靠地区分十个用户。 *识别与标注*:调用识别器(ArcFace、ECAPA-TDNN)并存储其返回的标签(“说话者47”)。模型能回忆分配的标签,但从未存储实际感知,因此无法将新声音与先前的声音进行比较。 *逐概念微调*:为每个概念微调专用标记或适配器。虽然有效,但这种方法不切实际。每个身份需要梯度更新,且产生的工件是特定于概念的。对于注册数十个新人、新声音和新物体的用户,这种成本结构无法扩展。 保留信号的路径,及其不足之处。 *嵌入检索*:完全绕过文本:它通过原始感知嵌入建立索引,并通过余弦相似性检索。这是唯一保留原始感知的无文本路径,也是我们最强的基线。它成功到编码器在不同记录条件下具有不变性的程度,当不变性被打破时则失败。在一个2180个身份的人脸库中,它在十个身份时达到0\.95的召回率,但随着库的扩大,性能下降。至关重要的是,此方法假设感知*已经*被干净地分离——即接收到干净的声纹或紧凑的人脸裁剪。在现实杂乱场景中,这个分离步骤本身就极其困难。裸编码器在此无能为力:嵌入整个两人照片仅能以0\.05的准确率识别目标人物(第5节)。 这是所有四条路径都混淆的第二个问题:*定位*指代对象与*识别*指代对象是不同的。即使是最强的无文本路径也只解决了后者。我们的方法建立在此身份步骤之上,同时解决其两个关键缺陷。我们在其前面放置一个视觉-语言模型进行定位(解析并定位目标指代对象),并将生成的身份赋予模型内部的新归宿。我们不从外部索引中检索邻居,而是将编码器密钥与专用标记标记一起存储,并直接在模型的输出头通过注意力读回。召回的身份因此成为模型在生成过程中可以依赖的原生标记。识别性能本身保持不变——我们的锐读近似于对编码器余弦相似性的硬argmax——但记忆现在额外提供了定位、模型内表示、O(1)的注册成本以及跨冻结模型的无缝可移植性。 ## 3 在模型自身表示中定位感知 我们将感知召回分解为三个步骤,依次处理:(1)使用视觉-语言模型在视觉或听觉上下文中*定位*指代对象;(2)使用专用编码器*识别*它;(3)将生成的身份*存储*为标记,以便在冻结的语言模型内部直接读取。前两步利用……
相似文章
超越检索:多模态智能体的分析记忆
本文介绍了AdaMM,一个通过分析记忆补充基于检索的多模态记忆的框架,能够对累积的观测进行过滤、聚合、排序和时间比较。在MemEye和MemGallery基准上的实验显示,性能分别提升了高达11.3%和7.3%。
从多模态经验中学会学习
本文介绍了AutoMMemo,一个使多模态智能体能够自动设计记忆机制(可表达为可执行的备忘录程序)以从多模态交互轨迹中学习的框架,在GUI/Web导航和视觉推理基准上优于无记忆和固定记忆基线。
在长期用户交互中个性化具身多模态大语言模型智能体
本文提出Polar,一种多模态记忆增强框架,用于在长期用户交互中个性化具身MLLM智能体,利用知识图谱和情景记忆从累积上下文中定位用户意图的实例。
EM^2Mem:面向大语言模型的事件中心多模态记忆
EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。
MemEye:面向多模态智能体记忆的视觉中心评估框架
MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。