RelightFormer: 用于多视图物体重光照的前馈生成Transformer
摘要
RelightFormer 引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,使用交叉注意力进行光照注入和排列不变编码以处理无序视图,通过在大量合成数据集上训练实现最先进的视觉质量。
查看缓存全文
缓存时间: 2026/09/09 08:29
论文页面 - RelightFormer:用于多视角物体重光照的前馈生成式Transformer
来源:https://huggingface.co/papers/2609.07414
摘要
一种前馈生成式Transformer通过交叉注意力注入目标光照,并使用置换不变编码处理无序视角,从而在大型合成数据集上训练,实现了直接的单视角和多视角图像重光照。
图像重光照传统上通过复杂的逆向渲染流程解决,这面临不适定优化问题,或采用单图像生成模型,但后者忽略了理解3D几何与材质交互所需的关键多视角线索。为解决这些限制,我们提出了一种前馈生成式Transformer,用于直接的单视角和多视角图像重光照,完全跳过了显式的内在属性估计。该架构基于视频基础模型改造,其特征是采用潜在光照模块,通过交叉注意力动态地将目标环境贴图注入空间特征。此外,我们使用置换不变位置编码来对称处理无序的多视角输入,避免顺序偏差。为训练这个鲁棒的数据驱动模型,我们构建了大规模的Laval Objaverse数据集,包含9万物体和3.9万唯一光照环境。大量实验表明,该方法在单视角、多视角和新视角重光照任务中,实现了最先进的视觉质量、照片级重光照效果和强大的零样本泛化能力。
查看 arXiv 页面 (https://arxiv.org/abs/2609.07414) | 查看 PDF (https://arxiv.org/pdf/2609.07414) | 项目页面 (https://github.com/vLAR-group/RelightFormer) | GitHub (https://github.com/vLAR-group/RelightFormer) | 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.07414)
引用本文的模型(0)
无模型链接本文。
在模型的 README.md 中引用 arxiv.org/abs/2609.07414 即可从本页链接。
引用本文的数据集(0)
无数据集链接本文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.07414 即可从本页链接。
引用本文的 Spaces(0)
无 Space 链接本文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.07414 即可从本页链接。
包含本文的收藏集(0)
无收藏集包含本文。
将本文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
GenRecon:结合生成先验的多视图3D场景重建
GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。
WildRelight:面向单图像重光照的实世界基准与物理引导自适应
本文介绍了 WildRelight,这是一个针对单图像重光照的实世界基准数据集,旨在弥合合成场景与自然场景之间的差距。该研究提出了一种物理引导的自适应框架,利用扩散后验采样和测试时自适应来提升模型在实世界数据上的表现。
RayDer:从真实世界视频中实现可扩展的自监督新颖视图合成
RayDer 是一个统一的前馈变换器,它将相机估计、场景重建和渲染整合到单一架构中,用于从真实世界视频进行自监督的新颖视图合成,实现了清晰的幂律扩展和强大的零样本性能。
RenderFormer-V2:基于异构场景图元的神经渲染
RenderFormer-V2是一种基于Transformer的神经渲染模型,它使用两阶段序列到序列架构,结合改进的注意力机制,支持异构场景图元,能够处理多样化的光传输效果。
Relit-LiVE:通过联合学习环境视频实现视频重光照
本文介绍了 Relit-LiVE,这是一种新颖的视频重光照框架。它利用原始参考图像和联合环境视频预测,在无需相机姿态信息的情况下生成物理一致的结果。