RelightFormer: 用于多视图物体重光照的前馈生成Transformer

Hugging Face Daily Papers 论文

摘要

RelightFormer 引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,使用交叉注意力进行光照注入和排列不变编码以处理无序视图,通过在大量合成数据集上训练实现最先进的视觉质量。

传统上,图像重光照通过复杂的逆向渲染流水线来解决,这些方法受限于不适定优化,或者使用单图像生成模型,这些模型忽略了理解3D几何和材质交互所需的关键多视图线索。为解决这些限制,我们引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,完全绕过显式固有属性估计。该架构改编自视频基础模型,包含一个潜在光照模块,通过交叉注意力动态注入目标环境贴图到空间特征中。此外,我们采用排列不变位置编码,对称处理无序多视图输入,无序列偏见。为训练这个稳健的数据驱动模型,我们构建了大规模Laval Objaverse数据集(LOD),包含9万个物体和3.9万个唯一光照。大量实验表明,该方法实现了最先进的视觉质量、照片级真实的重光照质量,以及在单视图、多视图和新视图重光照任务中的强大零样本泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:29

论文页面 - RelightFormer:用于多视角物体重光照的前馈生成式Transformer

来源:https://huggingface.co/papers/2609.07414

摘要

一种前馈生成式Transformer通过交叉注意力注入目标光照,并使用置换不变编码处理无序视角,从而在大型合成数据集上训练,实现了直接的单视角和多视角图像重光照。

图像重光照传统上通过复杂的逆向渲染流程解决,这面临不适定优化问题,或采用单图像生成模型,但后者忽略了理解3D几何与材质交互所需的关键多视角线索。为解决这些限制,我们提出了一种前馈生成式Transformer,用于直接的单视角和多视角图像重光照,完全跳过了显式的内在属性估计。该架构基于视频基础模型改造,其特征是采用潜在光照模块,通过交叉注意力动态地将目标环境贴图注入空间特征。此外,我们使用置换不变位置编码来对称处理无序的多视角输入,避免顺序偏差。为训练这个鲁棒的数据驱动模型,我们构建了大规模的Laval Objaverse数据集,包含9万物体和3.9万唯一光照环境。大量实验表明,该方法在单视角、多视角和新视角重光照任务中,实现了最先进的视觉质量、照片级重光照效果和强大的零样本泛化能力。

查看 arXiv 页面 (https://arxiv.org/abs/2609.07414) | 查看 PDF (https://arxiv.org/pdf/2609.07414) | 项目页面 (https://github.com/vLAR-group/RelightFormer) | GitHub (https://github.com/vLAR-group/RelightFormer) | 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.07414)

引用本文的模型(0)

无模型链接本文。

在模型的 README.md 中引用 arxiv.org/abs/2609.07414 即可从本页链接。

引用本文的数据集(0)

无数据集链接本文。

在数据集的 README.md 中引用 arxiv.org/abs/2609.07414 即可从本页链接。

引用本文的 Spaces(0)

无 Space 链接本文。

在 Space 的 README.md 中引用 arxiv.org/abs/2609.07414 即可从本页链接。

包含本文的收藏集(0)

无收藏集包含本文。

将本文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

GenRecon:结合生成先验的多视图3D场景重建

Hugging Face Daily Papers

GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。

WildRelight:面向单图像重光照的实世界基准与物理引导自适应

Hugging Face Daily Papers

本文介绍了 WildRelight,这是一个针对单图像重光照的实世界基准数据集,旨在弥合合成场景与自然场景之间的差距。该研究提出了一种物理引导的自适应框架,利用扩散后验采样和测试时自适应来提升模型在实世界数据上的表现。

RenderFormer-V2:基于异构场景图元的神经渲染

Hugging Face Daily Papers

RenderFormer-V2是一种基于Transformer的神经渲染模型,它使用两阶段序列到序列架构,结合改进的注意力机制,支持异构场景图元,能够处理多样化的光传输效果。