MemLearner:学习为视频世界模型查询上下文记忆
摘要
MemLearner 提出了一种基于学习的自适应上下文查询方法,使用查询令牌来改善视频世界模型中的场景一致性和记忆,特别适用于具有遮挡和动态物体的长序列。
查看缓存全文
缓存时间: 2026/07/01 03:40
论文页面 - MemLearner:学习查询上下文记忆以用于视频世界模型
Source: https://huggingface.co/papers/2606.31734
摘要
MemLearner 通过使用基于学习的自适应上下文查询和查询令牌,增强包含遮挡和动态物体的长视频序列中的场景一致性和记忆,从而改进视频世界模型。
视频世界模型(https://huggingface.co/papers?q=Video%20World%20Models)是交互式视频生成模型(https://huggingface.co/papers?q=video%20generation%20model),其根据用户动作和历史视频帧预测未来世界状态。视频世界模型(https://huggingface.co/papers?q=video%20world%20models)的一个关键挑战是缺乏记忆(https://huggingface.co/papers?q=memory),导致长时间生成的场景不一致。先前的方法探索了基于规则的上下文帧检索(https://huggingface.co/papers?q=context%20frame%20retrieval)作为记忆(https://huggingface.co/papers?q=memory),但在场景遮挡和动态物体的场景中泛化能力不足。我们提出 MemLearner,一种基于学习的自适应上下文查询方法,使用查询令牌(https://huggingface.co/papers?q=query%20tokens)来桥接上下文和预测令牌。通过利用视频生成模型(https://huggingface.co/papers?q=video%20generation%20model)自身进行上下文查询,MemLearner 利用了预训练的视觉先验(https://huggingface.co/papers?q=visual%20priors),无需从头训练额外模块,并融入了高效的训练和推理策略。我们收集了一个包含场景遮挡和动态物体的长视频数据集,并配有相机位姿标注(https://huggingface.co/papers?q=camera%20pose%20annotations),提出了一种多数据集训练策略(https://huggingface.co/papers?q=multi-dataset%20training%20strategy),同时利用带标注的渲染视频和无标注的真实世界视频。大量实验表明,MemLearner 在场景一致性(https://huggingface.co/papers?q=scene%20consistency)和记忆(https://huggingface.co/papers?q=memory)方面显著优于先前的视频世界模型(https://huggingface.co/papers?q=video%20world%20models),尤其在具有挑战性的遮挡和动态场景下。
查看 arXiv 页面 (https://arxiv.org/abs/2606.31734)查看 PDF (https://arxiv.org/pdf/2606.31734)项目页面 (https://yujiwen.github.io/memlearner/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.31734)
在你的代理中获取此论文:
hf papers read 2606\.31734
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有与此论文关联的模型
在模型 README.md 中引用 arxiv.org/abs/2606.31734 以从此页面链接。
引用此论文的数据集0
没有与此论文关联的数据集
在数据集 README.md 中引用 arxiv.org/abs/2606.31734 以从此页面链接。
引用此论文的 Spaces0
没有与此论文关联的 Space
在 Space README.md 中引用 arxiv.org/abs/2606.31734 以从此页面链接。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
MemTrain:自监督上下文记忆训练
MemTrain 提出了一种自监督训练框架,通过在维基百科语料上使用掩码重建和中间记忆召回代理任务,增强 LLM 智能体的上下文记忆能力,在下游记忆密集型 QA 基准上取得了高达 17.67 个百分点的提升。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
MBench:面向视频世界模型记忆能力的综合基准
本文介绍了MBench,一个用于评估视频世界模型在长时间跨度下对实体、环境和因果一致性记忆能力的基准。
更少的上下文,更高的准确性:一种用于LLM代理的双时态记忆引擎,其中精简检索的上下文胜过了完整历史
本文介绍了Engram,一个开源的用于LLM代理的双时态记忆引擎,它通过检索一个紧凑的上下文片段(约9.6k token),在LongMemEval上以混合读取路径融合稠密、词汇、图和时间信号,比完整历史基线(79k token)高出10.4个准确率点。
MemEye:面向多模态智能体记忆的视觉中心评估框架
MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。