从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

Hugging Face Daily Papers 论文

摘要

本文提出了一个闭环框架,结合了基于物理的反射模拟、基于扩散的视频去反射模型(S2R-Removal)以及一个新的基准(S2R-Bench),实现了最先进的视频反射去除和快速推理。

透过玻璃拍摄的视频通常包含反射,这会降低视觉质量并干扰下游视觉任务。尽管单图像反射去除已被广泛研究,但视频反射去除在很大程度上仍未得到充分探索,原因在于缺乏成对的视频数据、时间上一致的去除模型以及专门的评估基准。我们提出了一个闭环框架,统一了基于物理的反射模拟、基于扩散的视频去反射和基准评估。我们的S2R-Synthesis流程通过在结构空间中进行基于物理的增强,并使用训练好的视频扩散渲染器渲染逼真的反射视频,从而生成成对的反射和无反射视频;该增强模拟了关键玻璃相关效应,包括粗糙度引起的模糊、厚度引起的重影和反射率变化。基于合成数据,我们引入了S2R-Removal,这是首个基于扩散的视频反射去除模型,它通过反射感知的潜在适应和单步像素-几何细化来适配预训练的视频扩散先验,在单步去噪中恢复干净的透射。我们进一步构建了S2R-Bench,这是首个视频反射去除基准,支持全参考评估和真实世界的人类感知评估。在S2R-Bench和多个公共图像基准上的实验证明了最先进的性能和比非扩散基线更快的推理速度,并验证了S2R-Synthesis的有效性。项目页面:https://codingwzp.github.io/VideoDereflection_S2R。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:34

论文页面 - 从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

来源:https://huggingface.co/papers/2608.11562 发布于8月12日

·

提交自 https://huggingface.co/HigherHu

Higher (https://huggingface.co/HigherHu) 于8月13日

摘要

一个结合基于物理的视频合成、基于扩散的视频去反射以及新基准的闭环框架,以快速推理实现了最先进的视频反射去除。通过玻璃拍摄的视频通常包含反射,这些反射会降低视觉质量并干扰下游视觉任务。尽管单图像反射去除已被广泛研究,但由于缺乏成对视频数据、时间连贯的去除模型以及专门的评估基准,视频反射去除仍未得到充分探索。我们提出了一个闭环框架,统一了基于物理的反射模拟(https://huggingface.co/papers?q=physics-grounded%20reflection%20simulation)、基于扩散的视频去反射(https://huggingface.co/papers?q=diffusion-based%20video%20dereflection)和基准评估。我们的S2R-Synthesis(https://huggingface.co/papers?q=S2R-Synthesis)流程通过在结构空间中进行物理基础的增强,并使用训练好的视频扩散渲染器(https://huggingface.co/papers?q=video%20diffusion%20renderer)渲染逼真的反射视频,生成成对的带反射和无反射视频;该增强对关键的玻璃相关效应进行建模,包括粗糙度引起的模糊、厚度引起的重影和反射率变化。基于合成数据,我们引入了S2R-Removal(https://huggingface.co/papers?q=S2R-Removal),这是首个基于扩散的视频反射去除模型,通过反射感知的潜在适应(https://huggingface.co/papers?q=reflection-aware%20latent%20adaptation)和一步像素几何细化(https://huggingface.co/papers?q=one-step%20pixel-geometric%20refinement)来适应预训练的视频扩散先验,在单步去噪中恢复干净的透射图像。我们进一步构建了S2R-Bench(https://huggingface.co/papers?q=S2R-Bench),这是首个视频反射去除基准,支持全参考评估和真实世界人类感知评估。在S2R-Bench(https://huggingface.co/papers?q=S2R-Bench)和多个公开图像基准上的实验证明了最先进的性能和比非扩散基线更快的推理速度,并验证了S2R-Synthesis(https://huggingface.co/papers?q=S2R-Synthesis)的有效性。项目页面:https://codingwzp.github.io/VideoDereflection_S2R/。

查看arXiv页面 (https://arxiv.org/abs/2608.11562) 查看PDF (https://arxiv.org/pdf/2608.11562) 项目页面 (https://codingwzp.github.io/VideoDereflection_S2R/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11562)

在你的智能体中获取这篇论文:

hf papers read 2608\.11562

还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.11562,即可从此页面链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.11562,即可从此页面链接到它。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.11562,即可从此页面链接到它。

收录此论文的合集0

没有合集收录此论文

将这篇论文添加到一个集合(https://huggingface.co/new-collection)中,即可从此页面链接到它。

相似文章

MirrorWorld:驯服视频扩散模型以生成镜面反射

Hugging Face Daily Papers

MirrorWorld 是一个反射感知的视频修复框架,通过分别建模语义内容(SRD)和几何空间排布(GTA)来改善视频中的镜面反射生成,相比现有的基于图像和视频修复的基线方法,取得了更好的反射重建效果。