MemDreamer:通过分层图记忆与代理检索机制解耦长视频理解中的感知与推理

Hugging Face Daily Papers 论文

摘要

MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。

当前视觉-语言模型在处理数小时长的视频时面临挑战,因为处理完整视觉序列会导致令牌爆炸和注意力稀释。为了克服这一问题,我们引入了 MemDreamer,将感知与推理解耦,将长视频理解转变为代理探索过程。作为一个即插即用的框架,它逐步流式处理视频以构建分层图记忆(Hierarchical Graph Memory),这是一种自上而下的三层语义抽象架构,其基础图捕获了时空和因果关系。在推理过程中,推理模型采用代理增强检索工具,通过观察-推理-行动循环来导航层次结构、搜索节点并遍历逻辑边。实验表明,MemDreamer 在四个主流基准测试中取得了最先进的结果,与人类专家的差距缩小至仅 3.7 分。它将推理上下文窗口限制在全上下文输入的仅 2%,同时实现了 12.5 个百分点的绝对准确率提升。此外,统计分析揭示了 VLM 在逻辑推理和长视频理解基准上的性能之间存在强正线性相关,将代理能力扩展确立为多模态理解的新范式。
查看原文
查看缓存全文

缓存时间: 2026/06/10 09:44

论文页面 - MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

Source: https://huggingface.co/papers/2606.07512

摘要

MemDreamer通过分层图记忆和智能体探索来解耦感知与推理,从而应对长视频理解挑战,在降低计算开销的同时实现了最先进的性能。

当前的视觉-语言模型(https://huggingface.co/papers?q=Vision-Language%20Models)在处理长达数小时的视频时存在困难,因为处理完整长度的视觉序列会导致严重的令牌爆炸(https://huggingface.co/papers?q=token%20explosion)和注意力稀释(https://huggingface.co/papers?q=attention%20dilution)。为解决这一问题,我们提出MemDreamer,将感知与推理解耦,将长视频理解转变为一种智能体探索(https://huggingface.co/papers?q=agentic%20exploration)过程。作为即插即用框架,它逐步流式传输视频以构建分层图记忆(https://huggingface.co/papers?q=Hierarchical%20Graph%20Memory),一种自上而下的三层语义抽象架构,由捕捉时空和因果关系的(https://huggingface.co/papers?q=causal%20relations)基础图锚定。在推理过程中,推理模型采用智能体工具增强检索(https://huggingface.co/papers?q=tool-augmented%20retrieval),通过观察-推理-行动循环(https://huggingface.co/papers?q=Observation-Reason-Action%20loop)导航层次结构、搜索节点并遍历逻辑边。实验表明,MemDreamer在四个主流基准测试上均取得了SOTA结果,与人类专家的差距缩小至仅3.7分。它将推理上下文窗口限制为全量内容的仅2%,同时实现了12.5分的绝对准确率提升。此外,统计分析揭示了VLM在逻辑推理和长视频理解基准之间的强正线性相关性,将智能体能力扩展确立为多模态理解(https://huggingface.co/papers?q=multimodal%20comprehension)的新范式。

查看arXiv页面(https://arxiv.org/abs/2606.07512) 查看PDF(https://arxiv.org/pdf/2606.07512) 项目页面(https://aim-uofa.github.io/MemDreamer/) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.07512)

引用本文的模型0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.07512 以从该页面链接。

引用本文的数据集0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.07512 以从该页面链接。

引用本文的 Spaces0

暂无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.07512 以从该页面链接。

包含本文的收藏0

暂无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从该页面链接。

相似文章

RRM:经验驱动的反思性检索记忆用于长时程多模态推理

arXiv cs.CL

本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。