MemDreamer:通过分层图记忆与代理检索机制解耦长视频理解中的感知与推理
摘要
MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。
查看缓存全文
缓存时间: 2026/06/10 09:44
论文页面 - MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism
Source: https://huggingface.co/papers/2606.07512
摘要
MemDreamer通过分层图记忆和智能体探索来解耦感知与推理,从而应对长视频理解挑战,在降低计算开销的同时实现了最先进的性能。
当前的视觉-语言模型(https://huggingface.co/papers?q=Vision-Language%20Models)在处理长达数小时的视频时存在困难,因为处理完整长度的视觉序列会导致严重的令牌爆炸(https://huggingface.co/papers?q=token%20explosion)和注意力稀释(https://huggingface.co/papers?q=attention%20dilution)。为解决这一问题,我们提出MemDreamer,将感知与推理解耦,将长视频理解转变为一种智能体探索(https://huggingface.co/papers?q=agentic%20exploration)过程。作为即插即用框架,它逐步流式传输视频以构建分层图记忆(https://huggingface.co/papers?q=Hierarchical%20Graph%20Memory),一种自上而下的三层语义抽象架构,由捕捉时空和因果关系的(https://huggingface.co/papers?q=causal%20relations)基础图锚定。在推理过程中,推理模型采用智能体工具增强检索(https://huggingface.co/papers?q=tool-augmented%20retrieval),通过观察-推理-行动循环(https://huggingface.co/papers?q=Observation-Reason-Action%20loop)导航层次结构、搜索节点并遍历逻辑边。实验表明,MemDreamer在四个主流基准测试上均取得了SOTA结果,与人类专家的差距缩小至仅3.7分。它将推理上下文窗口限制为全量内容的仅2%,同时实现了12.5分的绝对准确率提升。此外,统计分析揭示了VLM在逻辑推理和长视频理解基准之间的强正线性相关性,将智能体能力扩展确立为多模态理解(https://huggingface.co/papers?q=multimodal%20comprehension)的新范式。
查看arXiv页面(https://arxiv.org/abs/2606.07512) 查看PDF(https://arxiv.org/pdf/2606.07512) 项目页面(https://aim-uofa.github.io/MemDreamer/) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.07512)
引用本文的模型0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.07512 以从该页面链接。
引用本文的数据集0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.07512 以从该页面链接。
引用本文的 Spaces0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.07512 以从该页面链接。
包含本文的收藏0
暂无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从该页面链接。
相似文章
基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
记忆是重构的,而非检索:LLM 代理的图记忆
MRAgent 提出了一种新颖的基于图的记忆框架,能在推理过程中动态重构记忆,在长程基准测试上实现高达 23% 的性能提升,同时降低了计算成本。
RRM:经验驱动的反思性检索记忆用于长时程多模态推理
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。
MemReread:通过记忆引导的重读增强智能体长上下文推理
MemReread 提出了一种长上下文推理方法,通过分解问题和重读文本来恢复被丢弃的信息,避免了中间检索,实现了线性时间复杂度。该方法在长上下文推理任务上优于基线框架。
MemReranker:面向智能体记忆检索的推理感知重排序
MemReranker 是一个针对智能体记忆检索设计的推理感知重排序模型家族(0.6B/4B),通过结合 LLM 知识蒸馏技术解决语义相似性匹配的局限性,从而提升模型的时间与因果推理能力。