Relit-LiVE:通过联合学习环境视频实现视频重光照
摘要
本文介绍了 Relit-LiVE,这是一种新颖的视频重光照框架。它利用原始参考图像和联合环境视频预测,在无需相机姿态信息的情况下生成物理一致的结果。
查看缓存全文
缓存时间: 2026/05/13 12:13
Paper page - Relit-LiVE: Relight Video by Jointly Learning Environment Video
Source: https://huggingface.co/papers/2605.06658
Abstract
本文提出了一种名为 Relit-LiVE 的新型视频重光照框架,该框架通过引入原始参考图像并利用环境视频预测进行联合重光照和环境贴图生成,无需相机姿态信息即可生成物理一致的结果。
近期的研究表明,大型视频扩散模型 (https://huggingface.co/papers?q=video%20diffusion%20models) 可以首先将视频分解为内蕴场景表示 (https://huggingface.co/papers?q=intrinsic%20scene%20representations),然后在新型光照条件下进行前向渲染 (https://huggingface.co/papers?q=forward%20rendering),从而被重新用作神经渲染器 (https://huggingface.co/papers?q=neural%20renderers)。尽管这一范式前景广阔,但其根本上依赖于准确的内蕴分解,而这一过程在真实世界视频中仍然高度不可靠,往往导致重光照过程中出现外观扭曲、材质破损以及累积的时间伪影。在本工作中,我们提出了 Relit-LiVE,这是一种新型视频重光照 (https://huggingface.co/papers?q=video%20relighting) 框架,能够在无需预先知道相机姿态的情况下,生成物理一致且时间稳定的结果。我们的核心见解是明确地将原始参考图像引入渲染过程,使模型能够恢复那些在内蕴表示中不可避免丢失或损坏的关键场景线索。此外,我们提出了一种新颖的环境视频预测 (https://huggingface.co/papers?q=environment%20video%20prediction) 公式,在单一的扩散过程 (https://huggingface.co/papers?q=diffusion%20process) 中同时生成重光照视频和与每个相机视点对齐的逐帧环境贴图。这种联合预测强制实现了强几何-光照对齐 (https://huggingface.co/papers?q=geometric-illumination%20alignment),并自然支持动态光照和相机运动,在放宽对已知逐帧相机姿态要求的同时,显著提高了视频重光照 (https://huggingface.co/papers?q=video%20relighting) 的物理一致性。大量实验表明,Relit-LiVE 在合成和真实世界基准测试中始终优于最先进的视频重光照 (https://huggingface.co/papers?q=video%20relighting) 和神经渲染 (https://huggingface.co/papers?q=neural%20rendering) 方法。除了重光照之外,我们的框架还支持广泛的下游应用,包括场景级渲染、材质编辑、物体插入和流式视频重光照 (https://huggingface.co/papers?q=video%20relighting)。项目地址见 https://github.com/zhuxing0/Relit-LiVE。
View arXiv page (https://arxiv.org/abs/2605.06658)View PDF (https://arxiv.org/pdf/2605.06658)Project page (https://zhuxing0.github.io/projects/Relit-LiVE/)GitHub (https://github.com/zhuxing0/Relit-LiVE)Add to collection (https://huggingface.co/login?next=%2Fpapers%2F2605.06658)
在您的 agent 中获取此论文:
hf papers read 2605.06658
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
Models citing this paper1
weiqingXiao/Relit-LiVE Image-to-Video• Updated5 days ago • 2 (https://huggingface.co/weiqingXiao/Relit-LiVE)
Datasets citing this paper0
No dataset linking this paper
Cite arxiv.org/abs/2605.06658 in a dataset README.md to link it from this page.
Spaces citing this paper0
No Space linking this paper
Cite arxiv.org/abs/2605.06658 in a Space README.md to link it from this page.
Collections including this paper0
No Collection including this paper
Add this paper to acollection (https://huggingface.co/new-collection)to link it from this page.
相似文章
WildRelight:面向单图像重光照的实世界基准与物理引导自适应
本文介绍了 WildRelight,这是一个针对单图像重光照的实世界基准数据集,旨在弥合合成场景与自然场景之间的差距。该研究提出了一种物理引导的自适应框架,利用扩散后验采样和测试时自适应来提升模型在实世界数据上的表现。
LongE2V: 基于视频扩散模型的长时段事件视频重建、预测与帧插值
LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。
先想象后预测:用于视频事件预测的交错潜在视觉推理
介绍了Future-L1,一种交错潜在视觉推理框架,通过在潜在空间中保持视觉语义来改进视频事件预测。在FutureBench和TwiFF-Bench基准上取得了最先进的结果。
ReImagine:以图像为先的可控高质量人体视频生成新思路
ReImagine 提出“图像优先”的可控高质量人体视频生成方案,借助 SMPL-X 动作引导与视频扩散模型,将外观建模与时间一致性解耦。
LongLive-RAG:一种通用的检索增强长视频生成框架
LongLive-RAG将长视频生成形式化为检索增强生成问题,利用先前生成潜变量的动态记忆来减少误差积累和身份漂移,在多种自回归骨干网络上提升了生成质量。