MirrorWorld:驯服视频扩散模型以生成镜面反射
摘要
MirrorWorld 是一个反射感知的视频修复框架,通过分别建模语义内容(SRD)和几何空间排布(GTA)来改善视频中的镜面反射生成,相比现有的基于图像和视频修复的基线方法,取得了更好的反射重建效果。
查看缓存全文
缓存时间: 2026/08/12 08:22
论文页面 - MirrorWorld:驯服视频扩散模型以生成镜面反射
来源:https://huggingface.co/papers/2608.07463
摘要
MirrorWorld 通过关系蒸馏和变换对齐,分别建模语义内容关联和几何空间排列,从而改进视频镜面反射合成。
近年来,视频扩散模型(VDMs)的进展实现了高保真视频合成。然而,生成镜面反射仍然具有挑战性,因为镜中的内容必须与周围场景保持一致。现有的 VDM 并非专门为建模场景到镜面的关系而设计,这可能导致反射内容错误或空间排列不一致。我们观察到,镜面反射生成涉及两个互补的挑战:确定哪些场景内容应被反射,以及反射内容在镜子区域内应如何空间排列。基于这一观察,我们提出了 MirrorWorld,一个反射感知的视频修复框架,在生成过程中对场景到镜面的关系进行建模。具体来说,我们引入了语义关系蒸馏(SRD),它从冻结的视觉基础模型中转移关系信息,以促进可见场景内容与镜子区域之间的语义关联。我们进一步提出了几何变换对齐(GTA),它学习一种变换来引导反射内容的空间排列。这两个组件扮演互补的角色:SRD 建模应该反射什么,GTA 建模如何排列。为了促进对该问题的研究,我们构建了一个视频镜面反射生成基准,将四个现有的视频镜子数据集重新用于统一的反射重建任务。实验结果表明,MirrorWorld 在反射重建质量上优于有代表性的基于图像的反射生成方法和强大的视频修复基线方法。
查看 arXiv 页面 (https://arxiv.org/abs/2608.07463) 查看 PDF (https://arxiv.org/pdf/2608.07463) 项目页面 (https://youjunzhao.github.io/MirrorWorld/) GitHub7 (https://github.com/YoujunZhao/MirrorWorld) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.07463)
在你的智能体中获取这篇论文:
hf papers read 2608\.07463
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有链接该论文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.07463,即可从本页链接到该模型。
引用该论文的数据集0
没有链接该论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.07463,即可从本页链接到该数据集。
引用该论文的 Space0
没有链接该论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2608.07463,即可从本页链接到该 Space。
包含该论文的集合0
没有包含该论文的集合
将此论文添加到集合 (https://huggingface.co/new-collection) 中,即可从本页链接到该集合。
相似文章
Mirror Learning
This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.
ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
ReflectWorld-MM 是一个面向实体的多模态记忆系统,专为开放式视频流设计,采用受人类记忆理论启发的分层长期记忆,在六个基准测试中达到了最先进的准确率。
用于视频世界模型的潜在空间记忆
本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
minWM:用于实时交互式视频世界模型的全栈开源框架
minWM 是一个全栈开源框架,可将双向视频扩散模型转换为实时交互式视频世界模型,支持可控相机、低延迟推演和模块化架构。