LayerRecall: 一个用于视频生成中长期一致性的状态条件记忆路由器
摘要
LayerRecall 通过选择性地将历史记忆路由到特定层,并在跨视野预测匹配的监督下,改善扩散模型中的长视频一致性。
查看缓存全文
缓存时间: 2026/09/01 12:10
论文页面 - LayerRecall:用于视频生成长程一致性的状态条件记忆路由器
来源:https://huggingface.co/papers/2608.28460 发布于 8月28日
·
由 Yixuan-Ding-ZJU 提交
ding 于 8月31日
摘要
LayerRecall 通过有选择性地将长期历史记忆路由到特定的视频扩散层,以改善长视频的一致性,该过程由跨时域预测匹配监督实现。
自回归视频扩散模型 (https://huggingface.co/papers?q=Autoregressive%20video%20diffusion) 通过从有限的近期上下文中生成块,实现了可扩展的长视频生成。虽然基于近期性的缓存保留了局部连续性,但会丢弃当主体、物体、场景或属性重现时所需的历史线索。现有的记忆机制使模型能够接触非局部的历史信息,但访问本身并不能保证有效利用。我们的分析表明,视频 DiT (https://huggingface.co/papers?q=video%20DiT) 层对当前、近期和远距离上下文表现出不同的偏好,这表明长期记忆 (https://huggingface.co/papers?q=long-range%20memory) 既需要决定检索什么内容,也需要决定在何处使用。我们引入了 LayerRecall (https://huggingface.co/papers?q=LayerRecall),一种基于当前状态、具有层选择性的记忆路由器 (https://huggingface.co/papers?q=layer-selective%20memory%20router),它检索相关的历史 K/V 状态 (https://huggingface.co/papers?q=K%2FV%20states),并仅将其注入到骨干网络中特定的记忆敏感层 (https://huggingface.co/papers?q=memory-sensitive%20layers),同时在其他地方保留局部注意力。为了减少对稀缺的高质量长时域视频和显式记忆分配标签的依赖,我们进一步提出了跨时域预测匹配 (https://huggingface.co/papers?q=Cross-Horizon%20Prediction%20Matching)(CHPM),它使用特权长上下文参考在预测空间中监督有限记忆的路由器。在 100 个多镜头评估提示中,LayerRecall (https://huggingface.co/papers?q=LayerRecall) 在 MemoBench 和 MovieBench 上取得了最佳的整体结果,同时在 VBench-Long 上与其骨干网络表现相当,在保持局部连续性的同时展示了更强的长程恢复能力。定性分析进一步揭示了记忆引导的自我修正,即最初不匹配的局部属性会在不重置正在进行的运动或场景结构的情况下,恢复到其历史外观。额外的分析显示了跨骨干网络的可移植性以及可忽略的推理开销。
查看 arXiv 页面 (https://arxiv.org/abs/2608.28460) 查看 PDF (https://arxiv.org/pdf/2608.28460) 项目页面 (https://yixuan-ding-zju.github.io/LayerRecall_Web/) GitHub9 (https://github.com/Yixuan-Ding-ZJU/LayerRecall) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.28460)
在你的代理中获取本文:
hf papers read 2608\.28460
没有最新的 CLI?请运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 1
Yixuan-Ding-ZJU/LayerRecall 文本生成视频 • 更新于约 5 小时前 • 1 (https://huggingface.co/Yixuan-Ding-ZJU/LayerRecall)
引用本文的数据集 0
没有数据集链接到本文。
在数据集的 README.md 中引用 arxiv.org/abs/2608.28460,以从此页面链接到该数据集。
引用本文的 Spaces 1
包含本文的收藏夹 1
相似文章
FadeMem: 距离感知的记忆整合用于自回归视频扩散
FadeMem 引入了一种距离感知的键值记忆整合机制,将历史视频数据组织成时间层次结构,在固定缓存约束下改进长视频生成。
LongLive-RAG:一种通用的检索增强长视频生成框架
LongLive-RAG将长视频生成形式化为检索增强生成问题,利用先前生成潜变量的动态记忆来减少误差积累和身份漂移,在多种自回归骨干网络上提升了生成质量。
Memento:通过重建实现记忆,用于一致的长时间视频生成
Memento 是一个以主体重建为引导的框架,通过基于记忆的重建和双查询机制来保留重复出现的主体,从而改进长视频生成,在长期主体一致性和跨镜头连贯性方面达到了最先进的性能。
ReWorld:一个具有长期记忆的交互式世界模型
ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。
基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。