LongE2V: 基于视频扩散模型的长时段事件视频重建、预测与帧插值

Hugging Face Daily Papers 论文

摘要

LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。

从稀疏事件流中恢复高质量视频是一项具有挑战性的任务。回归方法往往会导致纹理模糊,而现有生成模型在长期稳定性方面存在困难。我们提出LongE2V,一种新颖的方法,利用预训练的视频扩散先验来联合处理基于事件的视频重建、预测和帧插值。通过微调基础视频模型,我们的方法实现了高数据效率和卓越的感知质量。我们引入了自回归展开和自适应上下文切换,以减轻极长序列中的时间漂移。我们还提出了带交叉残差校正的重编码对齐,以确保帧插值过程中精确的双向一致性。此外,事件体素密度增强确保了在不同传感器分辨率下的鲁棒性。在真实世界基准上的广泛实验表明,LongE2V在所有三个任务上均优于现有最先进方法,表现出卓越的时间一致性和零样本泛化能力。项目页面:https://cdfan0627.github.io/LongE2V-page/
查看原文
查看缓存全文

缓存时间: 2026/07/10 10:10

论文页面 - LongE2V:基于事件的长时域视频重建、预测与帧插值——利用视频扩散模型

Source: https://huggingface.co/papers/2607.08770

摘要

LongE2V 通过利用预训练视频扩散先验,并解决时间稳定性与帧插值挑战,实现了从稀疏事件流中恢复高质量视频。

从稀疏事件流中恢复高质量视频是一项具有挑战性的任务。回归方法往往导致纹理模糊,而现有的生成模型难以保持长期稳定性。我们提出 LongE2V,一种新颖的方法,利用预训练视频扩散先验 (https://huggingface.co/papers?q=video%20diffusion%20priors) 来联合处理基于事件的视频重建 (https://huggingface.co/papers?q=event-based%20video%20reconstruction)、预测 (https://huggingface.co/papers?q=event-based%20video%20prediction) 和帧插值 (https://huggingface.co/papers?q=frame%20interpolation)。通过微调基础视频模型,我们的方法实现了高数据效率和卓越的感知质量。我们引入了自回归展开 (https://huggingface.co/papers?q=Autoregressive%20Unrolling) 和自适应上下文切换 (https://huggingface.co/papers?q=Adaptive%20Context%20Switching),以缓解极长序列中的时间漂移 (https://huggingface.co/papers?q=temporal%20drift)。我们还提出了与跨残差校正 (https://huggingface.co/papers?q=Cross%20Residual%20Correction) 相结合的重新编码对齐 (https://huggingface.co/papers?q=Reencoding%20Alignment),以确保帧插值 (https://huggingface.co/papers?q=frame%20interpolation) 期间的精确双向一致性。此外,事件体素密度增强 (https://huggingface.co/papers?q=Event%20Voxel%20Density%20Augmentation) 确保了在不同传感器分辨率下的鲁棒性。在真实世界基准上的大量实验表明,LongE2V 在所有三个任务上均优于现有最优方法,展现出卓越的时间一致性和零样本泛化能力 (https://huggingface.co/papers?q=zero-shot%20generalization)。项目页面:https://cdfan0627.github.io/LongE2V-page/

查看 arXiv 页面 (https://arxiv.org/abs/2607.08770) 查看 PDF (https://arxiv.org/pdf/2607.08770) 项目页面 (https://cdfan0627.github.io/LongE2V-page/) GitHub (https://github.com/cdfan0627/LongE2V) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.08770)

在你的代理中获取这篇论文:

hf papers read 2607.08770

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

暂无模型关联本文

在模型的 README.md 中引用 arxiv.org/abs/2607.08770 即可从本页面链接。

引用本文的数据集0

暂无数据集关联本文

在数据集的 README.md 中引用 arxiv.org/abs/2607.08770 即可从本页面链接。

引用本文的空间0

暂无空间关联本文

在空间的 README.md 中引用 arxiv.org/abs/2607.08770 即可从本页面链接。

收录本文的收藏集0

暂无收藏集包含本文

将本文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

长视频生成(阅读时间 4 分钟)

TLDR AI

本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。