LayerRecall: 一个用于视频生成中长期一致性的状态条件记忆路由器

Hugging Face Daily Papers 论文

摘要

LayerRecall 通过选择性地将历史记忆路由到特定层,并在跨视野预测匹配的监督下,改善扩散模型中的长视频一致性。

自回归视频扩散通过从有界近期上下文生成片段,实现可扩展的长视频生成。虽然基于近期性的缓存保持了局部连续性,但它会淘汰当主体、物体、场景或属性重新出现时所需的历史线索。现有的记忆机制使模型暴露于非局部历史,但仅访问并不能确保有效使用。我们的分析表明,视频DiT层对当前、近期和远程上下文表现出不同的偏好,这表明长期记忆需要决定检索什么以及在哪里使用。我们引入LayerRecall,一个当前条件、层选择性的记忆路由器,它检索相关的历史K/V状态,并仅将其注入到骨干特定的记忆敏感层中,同时在其他地方保留局部注意力。为了减少对稀缺高质量长期视频和显式记忆分配标签的依赖,我们进一步提出了跨视野预测匹配(CHPM),它使用特权长上下文参考在预测空间中监督有界记忆路由器。在100个多镜头评估提示中,LayerRecall在MemoBench和MovieBench上取得了最佳整体结果,同时在VBench-Long上与其骨干网络匹配,展示了更强的长期恢复能力而不牺牲局部连续性。定性分析进一步揭示了记忆引导的自我修正,即最初不匹配的局部属性返回其历史外观,而不重置正在进行的运动或场景结构。其他分析显示了跨骨干可移植性和可忽略的推理开销。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:10

论文页面 - LayerRecall:用于视频生成长程一致性的状态条件记忆路由器

来源:https://huggingface.co/papers/2608.28460 发布于 8月28日

·

Yixuan-Ding-ZJU 提交

ding 于 8月31日

摘要

LayerRecall 通过有选择性地将长期历史记忆路由到特定的视频扩散层,以改善长视频的一致性,该过程由跨时域预测匹配监督实现。

自回归视频扩散模型 (https://huggingface.co/papers?q=Autoregressive%20video%20diffusion) 通过从有限的近期上下文中生成块,实现了可扩展的长视频生成。虽然基于近期性的缓存保留了局部连续性,但会丢弃当主体、物体、场景或属性重现时所需的历史线索。现有的记忆机制使模型能够接触非局部的历史信息,但访问本身并不能保证有效利用。我们的分析表明,视频 DiT (https://huggingface.co/papers?q=video%20DiT) 层对当前、近期和远距离上下文表现出不同的偏好,这表明长期记忆 (https://huggingface.co/papers?q=long-range%20memory) 既需要决定检索什么内容,也需要决定在何处使用。我们引入了 LayerRecall (https://huggingface.co/papers?q=LayerRecall),一种基于当前状态、具有层选择性的记忆路由器 (https://huggingface.co/papers?q=layer-selective%20memory%20router),它检索相关的历史 K/V 状态 (https://huggingface.co/papers?q=K%2FV%20states),并仅将其注入到骨干网络中特定的记忆敏感层 (https://huggingface.co/papers?q=memory-sensitive%20layers),同时在其他地方保留局部注意力。为了减少对稀缺的高质量长时域视频和显式记忆分配标签的依赖,我们进一步提出了跨时域预测匹配 (https://huggingface.co/papers?q=Cross-Horizon%20Prediction%20Matching)(CHPM),它使用特权长上下文参考在预测空间中监督有限记忆的路由器。在 100 个多镜头评估提示中,LayerRecall (https://huggingface.co/papers?q=LayerRecall) 在 MemoBench 和 MovieBench 上取得了最佳的整体结果,同时在 VBench-Long 上与其骨干网络表现相当,在保持局部连续性的同时展示了更强的长程恢复能力。定性分析进一步揭示了记忆引导的自我修正,即最初不匹配的局部属性会在不重置正在进行的运动或场景结构的情况下,恢复到其历史外观。额外的分析显示了跨骨干网络的可移植性以及可忽略的推理开销。

查看 arXiv 页面 (https://arxiv.org/abs/2608.28460)  查看 PDF (https://arxiv.org/pdf/2608.28460)  项目页面 (https://yixuan-ding-zju.github.io/LayerRecall_Web/)  GitHub9 (https://github.com/Yixuan-Ding-ZJU/LayerRecall)  添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.28460)

在你的代理中获取本文:

hf papers read 2608\.28460

没有最新的 CLI?请运行 curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 1

Yixuan-Ding-ZJU/LayerRecall 文本生成视频 • 更新于约 5 小时前 • 1 (https://huggingface.co/Yixuan-Ding-ZJU/LayerRecall)

引用本文的数据集 0

没有数据集链接到本文。

在数据集的 README.md 中引用 arxiv.org/abs/2608.28460,以从此页面链接到该数据集。

引用本文的 Spaces 1

包含本文的收藏夹 1

相似文章

ReWorld:一个具有长期记忆的交互式世界模型

Hugging Face Daily Papers

ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。