从合成到去除:基于物理的反射模拟与基于扩散的视频去反射
摘要
本文提出了一个闭环框架,结合了基于物理的反射模拟、基于扩散的视频去反射模型(S2R-Removal)以及一个新的基准(S2R-Bench),实现了最先进的视频反射去除和快速推理。
查看缓存全文
缓存时间: 2026/08/13 15:34
论文页面 - 从合成到去除:基于物理的反射模拟与基于扩散的视频去反射
来源:https://huggingface.co/papers/2608.11562 发布于8月12日
·
提交自 https://huggingface.co/HigherHu
Higher (https://huggingface.co/HigherHu) 于8月13日
摘要
一个结合基于物理的视频合成、基于扩散的视频去反射以及新基准的闭环框架,以快速推理实现了最先进的视频反射去除。通过玻璃拍摄的视频通常包含反射,这些反射会降低视觉质量并干扰下游视觉任务。尽管单图像反射去除已被广泛研究,但由于缺乏成对视频数据、时间连贯的去除模型以及专门的评估基准,视频反射去除仍未得到充分探索。我们提出了一个闭环框架,统一了基于物理的反射模拟(https://huggingface.co/papers?q=physics-grounded%20reflection%20simulation)、基于扩散的视频去反射(https://huggingface.co/papers?q=diffusion-based%20video%20dereflection)和基准评估。我们的S2R-Synthesis(https://huggingface.co/papers?q=S2R-Synthesis)流程通过在结构空间中进行物理基础的增强,并使用训练好的视频扩散渲染器(https://huggingface.co/papers?q=video%20diffusion%20renderer)渲染逼真的反射视频,生成成对的带反射和无反射视频;该增强对关键的玻璃相关效应进行建模,包括粗糙度引起的模糊、厚度引起的重影和反射率变化。基于合成数据,我们引入了S2R-Removal(https://huggingface.co/papers?q=S2R-Removal),这是首个基于扩散的视频反射去除模型,通过反射感知的潜在适应(https://huggingface.co/papers?q=reflection-aware%20latent%20adaptation)和一步像素几何细化(https://huggingface.co/papers?q=one-step%20pixel-geometric%20refinement)来适应预训练的视频扩散先验,在单步去噪中恢复干净的透射图像。我们进一步构建了S2R-Bench(https://huggingface.co/papers?q=S2R-Bench),这是首个视频反射去除基准,支持全参考评估和真实世界人类感知评估。在S2R-Bench(https://huggingface.co/papers?q=S2R-Bench)和多个公开图像基准上的实验证明了最先进的性能和比非扩散基线更快的推理速度,并验证了S2R-Synthesis(https://huggingface.co/papers?q=S2R-Synthesis)的有效性。项目页面:https://codingwzp.github.io/VideoDereflection_S2R/。
查看arXiv页面 (https://arxiv.org/abs/2608.11562) 查看PDF (https://arxiv.org/pdf/2608.11562) 项目页面 (https://codingwzp.github.io/VideoDereflection_S2R/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11562)
在你的智能体中获取这篇论文:
hf papers read 2608\.11562
还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.11562,即可从此页面链接到它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.11562,即可从此页面链接到它。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.11562,即可从此页面链接到它。
收录此论文的合集0
没有合集收录此论文
将这篇论文添加到一个集合(https://huggingface.co/new-collection)中,即可从此页面链接到它。
相似文章
MirrorWorld:驯服视频扩散模型以生成镜面反射
MirrorWorld 是一个反射感知的视频修复框架,通过分别建模语义内容(SRD)和几何空间排布(GTA)来改善视频中的镜面反射生成,相比现有的基于图像和视频修复的基线方法,取得了更好的反射重建效果。
ReflectDrive-2:面向离散扩散驾驶模型的强化学习对齐自编辑方法
ReflectDrive-2 是一款新型自动驾驶离散扩散规划器,通过强化学习实现轨迹 token 的自编辑,在 NAVSIM 基准测试中取得了高性能和低延迟。
BRDFusion: 物理与生成相结合的城市场景逆渲染
BRDFusion 将物理建模与生成先验相结合,实现了高质量的城市场景逆渲染和正向渲染,支持新颖视角重光照和动态物体插入等应用。
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
ReImagine:以图像为先的可控高质量人体视频生成新思路
ReImagine 提出“图像优先”的可控高质量人体视频生成方案,借助 SMPL-X 动作引导与视频扩散模型,将外观建模与时间一致性解耦。