EM^2Mem:面向大语言模型的事件中心多模态记忆

Hugging Face Daily Papers 论文

摘要

EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。

多模态记忆为长视频问答提供了可扩展的接口,但现有方法通常将字幕、帧、转录本、摘要或图事实作为孤立片段进行检索。尽管这些片段可搜索,但它们并非生成就绪:语言模型必须在推理时重建跨模态和时间对齐,而此时上下文有限且归因困难。我们提出了 EM^2Mem,这是一个事件中心的多模态记忆框架,在记忆构建过程中将异构证据绑定到事件锚点。每个事件索引的记忆单元对齐多模态记录、时间上下文、图链接关系、语义事实和溯源信息,从而支持基于多模态事件的紧凑证据读出,而非特定模态的片段。在三个长视频问答基准测试中,EM^2Mem 将平均准确性比最强记忆基线提高了 2.0、2.4 和 3.7 个百分点,将严格事件级别 Top-5 证据召回率提高了 7.0 个百分点,并将每查询延迟降低了 4.67 倍,总推理令牌数减少了 63.66%(代码将集成到 https://github.com/zjunlp/LightMem)。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:46

论文页面 - EM^2Mem:面向大语言模型的事件中心多模态记忆

来源:https://huggingface.co/papers/2609.00551 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

EM2Mem将多模态证据与事件锚点绑定,为长视频问答提供紧凑、可生成的记忆。

多模态记忆 (https://huggingface.co/papers?q=Multimodal%20memory) 为长视频问答提供了一种可扩展的接口,但现有方法通常将字幕、帧、转录文本、摘要或图谱事实作为孤立的片段进行检索。尽管这些片段是可搜索的,但它们并非“就绪可用“:语言模型必须在推理时重建跨模态和时间上的对齐,而此时上下文有限且归因困难。我们提出了 EM^2Mem,这是一个事件中心的多模态记忆 (https://huggingface.co/papers?q=multimodal%20memory) 框架,它在记忆构建过程中将异构证据绑定到事件锚点。每个事件索引的记忆单元对齐了多模态记录、时间上下文 (https://huggingface.co/papers?q=temporal%20context)、图谱关联关系 (https://huggingface.co/papers?q=graph-linked%20relations)、语义事实和来源 (https://huggingface.co/papers?q=provenance),从而能够基于有依据的多模态事件进行紧凑的证据读出,而不是基于特定模态的片段。在三个长视频 QA (https://huggingface.co/papers?q=long-video%20QA) 基准测试中,EM^2Mem 相较于最强的记忆基线,平均准确率分别提升了 2.0、2.4 和 3.7 个点,严格的事件级 Top-5 证据召回率 (https://huggingface.co/papers?q=evidence%20recall) 提升了 7.0 个点,并将每查询延迟降低了 4.67 倍,总推理 token 数减少了 63.66%。(代码将集成到 https://github.com/zjunlp/LightMem 中)。

查看 arXiv 页面 (https://arxiv.org/abs/2609.00551) 查看 PDF (https://arxiv.org/pdf/2609.00551) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.00551)

在你的代理中获取此论文:

hf papers read 2609\.00551

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.00551 以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.00551 以从此页面链接它。

引用此论文的空间0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.00551 以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

δ-mem:大型语言模型的高效在线记忆机制

Hugging Face Daily Papers

本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。