LongE2V: 基于视频扩散模型的长时段事件视频重建、预测与帧插值
摘要
LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。
查看缓存全文
缓存时间: 2026/07/10 10:10
论文页面 - LongE2V:基于事件的长时域视频重建、预测与帧插值——利用视频扩散模型
Source: https://huggingface.co/papers/2607.08770
摘要
LongE2V 通过利用预训练视频扩散先验,并解决时间稳定性与帧插值挑战,实现了从稀疏事件流中恢复高质量视频。
从稀疏事件流中恢复高质量视频是一项具有挑战性的任务。回归方法往往导致纹理模糊,而现有的生成模型难以保持长期稳定性。我们提出 LongE2V,一种新颖的方法,利用预训练视频扩散先验 (https://huggingface.co/papers?q=video%20diffusion%20priors) 来联合处理基于事件的视频重建 (https://huggingface.co/papers?q=event-based%20video%20reconstruction)、预测 (https://huggingface.co/papers?q=event-based%20video%20prediction) 和帧插值 (https://huggingface.co/papers?q=frame%20interpolation)。通过微调基础视频模型,我们的方法实现了高数据效率和卓越的感知质量。我们引入了自回归展开 (https://huggingface.co/papers?q=Autoregressive%20Unrolling) 和自适应上下文切换 (https://huggingface.co/papers?q=Adaptive%20Context%20Switching),以缓解极长序列中的时间漂移 (https://huggingface.co/papers?q=temporal%20drift)。我们还提出了与跨残差校正 (https://huggingface.co/papers?q=Cross%20Residual%20Correction) 相结合的重新编码对齐 (https://huggingface.co/papers?q=Reencoding%20Alignment),以确保帧插值 (https://huggingface.co/papers?q=frame%20interpolation) 期间的精确双向一致性。此外,事件体素密度增强 (https://huggingface.co/papers?q=Event%20Voxel%20Density%20Augmentation) 确保了在不同传感器分辨率下的鲁棒性。在真实世界基准上的大量实验表明,LongE2V 在所有三个任务上均优于现有最优方法,展现出卓越的时间一致性和零样本泛化能力 (https://huggingface.co/papers?q=zero-shot%20generalization)。项目页面:https://cdfan0627.github.io/LongE2V-page/
查看 arXiv 页面 (https://arxiv.org/abs/2607.08770) 查看 PDF (https://arxiv.org/pdf/2607.08770) 项目页面 (https://cdfan0627.github.io/LongE2V-page/) GitHub (https://github.com/cdfan0627/LongE2V) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.08770)
在你的代理中获取这篇论文:
hf papers read 2607.08770
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
暂无模型关联本文
在模型的 README.md 中引用 arxiv.org/abs/2607.08770 即可从本页面链接。
引用本文的数据集0
暂无数据集关联本文
在数据集的 README.md 中引用 arxiv.org/abs/2607.08770 即可从本页面链接。
引用本文的空间0
暂无空间关联本文
在空间的 README.md 中引用 arxiv.org/abs/2607.08770 即可从本页面链接。
收录本文的收藏集0
暂无收藏集包含本文
将本文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
长视频生成(阅读时间 4 分钟)
本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。
先想象后预测:用于视频事件预测的交错潜在视觉推理
介绍了Future-L1,一种交错潜在视觉推理框架,通过在潜在空间中保持视觉语义来改进视频事件预测。在FutureBench和TwiFF-Bench基准上取得了最先进的结果。
LVSA: 用于长视频扩散的无训练稀疏注意力
LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
VideoMLA:用于分钟级自回归视频扩散的低秩潜变量KV缓存
VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。