MemLearner:学习为视频世界模型查询上下文记忆

Hugging Face Daily Papers 论文

摘要

MemLearner 提出了一种基于学习的自适应上下文查询方法,使用查询令牌来改善视频世界模型中的场景一致性和记忆,特别适用于具有遮挡和动态物体的长序列。

视频世界模型是一种交互式视频生成模型,能够根据用户操作和历史视频帧预测未来世界状态。视频世界模型面临的一个关键挑战是缺乏记忆,导致在长时间序列中生成的场景不一致。以往的方法探索了基于规则的上下文帧检索作为记忆,但在场景遮挡和动态物体的情况下难以泛化。我们提出 MemLearner,一种基于学习的自适应上下文查询方法,使用查询令牌来桥接上下文和预测令牌。通过利用视频生成模型本身进行上下文查询,MemLearner 利用了预训练的视觉先验,无需从头训练额外模块,并在训练和推理中采用了高效的策略。我们收集了一个包含场景遮挡和动态物体的长视频数据集,并配有相机姿态标注,同时提出了一种多数据集训练策略,结合了带标注的渲染视频和无标注的真实世界视频。大量实验表明,MemLearner 在场景一致性和记忆方面显著优于先前的视频世界模型,特别是在具有挑战性的遮挡和动态场景下。
查看原文
查看缓存全文

缓存时间: 2026/07/01 03:40

论文页面 - MemLearner:学习查询上下文记忆以用于视频世界模型

Source: https://huggingface.co/papers/2606.31734

摘要

MemLearner 通过使用基于学习的自适应上下文查询和查询令牌,增强包含遮挡和动态物体的长视频序列中的场景一致性和记忆,从而改进视频世界模型。

视频世界模型(https://huggingface.co/papers?q=Video%20World%20Models)是交互式视频生成模型(https://huggingface.co/papers?q=video%20generation%20model),其根据用户动作和历史视频帧预测未来世界状态。视频世界模型(https://huggingface.co/papers?q=video%20world%20models)的一个关键挑战是缺乏记忆(https://huggingface.co/papers?q=memory),导致长时间生成的场景不一致。先前的方法探索了基于规则的上下文帧检索(https://huggingface.co/papers?q=context%20frame%20retrieval)作为记忆(https://huggingface.co/papers?q=memory),但在场景遮挡和动态物体的场景中泛化能力不足。我们提出 MemLearner,一种基于学习的自适应上下文查询方法,使用查询令牌(https://huggingface.co/papers?q=query%20tokens)来桥接上下文和预测令牌。通过利用视频生成模型(https://huggingface.co/papers?q=video%20generation%20model)自身进行上下文查询,MemLearner 利用了预训练的视觉先验(https://huggingface.co/papers?q=visual%20priors),无需从头训练额外模块,并融入了高效的训练和推理策略。我们收集了一个包含场景遮挡和动态物体的长视频数据集,并配有相机位姿标注(https://huggingface.co/papers?q=camera%20pose%20annotations),提出了一种多数据集训练策略(https://huggingface.co/papers?q=multi-dataset%20training%20strategy),同时利用带标注的渲染视频和无标注的真实世界视频。大量实验表明,MemLearner 在场景一致性(https://huggingface.co/papers?q=scene%20consistency)和记忆(https://huggingface.co/papers?q=memory)方面显著优于先前的视频世界模型(https://huggingface.co/papers?q=video%20world%20models),尤其在具有挑战性的遮挡和动态场景下。

查看 arXiv 页面 (https://arxiv.org/abs/2606.31734)查看 PDF (https://arxiv.org/pdf/2606.31734)项目页面 (https://yujiwen.github.io/memlearner/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.31734)

在你的代理中获取此论文:

hf papers read 2606\.31734

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有与此论文关联的模型

在模型 README.md 中引用 arxiv.org/abs/2606.31734 以从此页面链接。

引用此论文的数据集0

没有与此论文关联的数据集

在数据集 README.md 中引用 arxiv.org/abs/2606.31734 以从此页面链接。

引用此论文的 Spaces0

没有与此论文关联的 Space

在 Space README.md 中引用 arxiv.org/abs/2606.31734 以从此页面链接。

包含此论文的收藏0

没有包含此论文的收藏

将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

MemTrain:自监督上下文记忆训练

arXiv cs.CL

MemTrain 提出了一种自监督训练框架,通过在维基百科语料上使用掩码重建和中间记忆召回代理任务,增强 LLM 智能体的上下文记忆能力,在下游记忆密集型 QA 基准上取得了高达 17.67 个百分点的提升。

MemEye:面向多模态智能体记忆的视觉中心评估框架

Hugging Face Daily Papers

MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。