EM^2Mem:面向大语言模型的事件中心多模态记忆
摘要
EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。
查看缓存全文
缓存时间: 2026/09/02 03:46
论文页面 - EM^2Mem:面向大语言模型的事件中心多模态记忆
来源:https://huggingface.co/papers/2609.00551 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
EM2Mem将多模态证据与事件锚点绑定,为长视频问答提供紧凑、可生成的记忆。
多模态记忆 (https://huggingface.co/papers?q=Multimodal%20memory) 为长视频问答提供了一种可扩展的接口,但现有方法通常将字幕、帧、转录文本、摘要或图谱事实作为孤立的片段进行检索。尽管这些片段是可搜索的,但它们并非“就绪可用“:语言模型必须在推理时重建跨模态和时间上的对齐,而此时上下文有限且归因困难。我们提出了 EM^2Mem,这是一个事件中心的多模态记忆 (https://huggingface.co/papers?q=multimodal%20memory) 框架,它在记忆构建过程中将异构证据绑定到事件锚点。每个事件索引的记忆单元对齐了多模态记录、时间上下文 (https://huggingface.co/papers?q=temporal%20context)、图谱关联关系 (https://huggingface.co/papers?q=graph-linked%20relations)、语义事实和来源 (https://huggingface.co/papers?q=provenance),从而能够基于有依据的多模态事件进行紧凑的证据读出,而不是基于特定模态的片段。在三个长视频 QA (https://huggingface.co/papers?q=long-video%20QA) 基准测试中,EM^2Mem 相较于最强的记忆基线,平均准确率分别提升了 2.0、2.4 和 3.7 个点,严格的事件级 Top-5 证据召回率 (https://huggingface.co/papers?q=evidence%20recall) 提升了 7.0 个点,并将每查询延迟降低了 4.67 倍,总推理 token 数减少了 63.66%。(代码将集成到 https://github.com/zjunlp/LightMem 中)。
查看 arXiv 页面 (https://arxiv.org/abs/2609.00551) 查看 PDF (https://arxiv.org/pdf/2609.00551) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.00551)
在你的代理中获取此论文:
hf papers read 2609\.00551
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.00551 以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.00551 以从此页面链接它。
引用此论文的空间0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.00551 以从此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
S3Mem:面向长周期交互式问答的结构化时空场景事件记忆
S3Mem 提出了一种用于长周期交互式问答的结构化时空场景事件记忆框架,采用锚点敏感检索和令牌预算感知的证据接口,在多个环境中优于标准 RAG。
每个多模态证据一个Token:面向资源受限问答的Latent Memory
潜在记忆(Latent Memory)引入了一种用于问答中外部记忆的压缩表示方法,在减少Token消耗和存储需求的同时,在纯文本和多模态基准测试中保持有竞争力的表现。
参数化多模态用户记忆:存储文字描述无法传达的信息
本文介绍了一种参数化多模态用户记忆系统,通过整合语音和外貌等感知数据,利用视觉语言模型和专用编码器,提升AI智能体回忆用户的能力,从而超越基于文本的方法。
δ-mem:大型语言模型的高效在线记忆机制
本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。