RenderFormer-V2:基于异构场景图元的神经渲染
摘要
RenderFormer-V2是一种基于Transformer的神经渲染模型,它使用两阶段序列到序列架构,结合改进的注意力机制,支持异构场景图元,能够处理多样化的光传输效果。
查看缓存全文
缓存时间: 2026/09/10 02:15
论文页面 - RenderFormer-V2:支持异构场景图元的神经渲染
来源:https://huggingface.co/papers/2609.05738
摘要
RenderFormer-V2是一种基于transformer的神经渲染模型,通过采用改进注意力机制的两阶段序列到序列架构,并支持异构场景,从而能够处理多样化的光线传输效果。
我们提出“RenderFormer-V2“,这是一个统一的、基于学习transformer的神经渲染模型,作为现代基于物理的渲染系统的补充,能够处理包括焦散、体积散射、环境光照、带纹理和位移的表面以及分布外材质在内的多种光线传输效果,无需进行场景特定训练或专用代码。RenderFormer-V2将全局光线传输建模为一种序列到序列变换。延续其前身的设计,RenderFormer-V2同样采用两阶段处理流程:第一阶段是视角无关阶段,解决场景内图元到图元的传输;第二阶段是视角相关阶段,将内部神经场景表示转换为图像像素。与RenderFormer不同,我们的模型在视角无关阶段采用了新颖的组合式窗口注意力和基于渲染先验的注意力汇聚机制,在保持渲染精度的同时提高了可扩展性。为了进一步增强通用性,RenderFormer-V2支持异构场景图元,包括环境贴图和参与介质,并采用了一种独立于底层表面反射模型的材质编码方式,通过一种新颖的神经嵌入对材质外观进行编码。我们在多种场景上展示了RenderFormer-V2的通用性,并对改进的注意力机制进行了全面的消融研究。
查看 arXiv 页面 (https://arxiv.org/abs/2609.05738) 查看 PDF (https://arxiv.org/pdf/2609.05738) 项目主页 (https://renderformer.github.io/v2/) GitHub1 (https://github.com/iamNCJ/RenderFormer-Studio) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.05738)
在你的智能体中获取这篇论文:
hf papers read 2609\.05738
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.05738 以从此页面链接到该模型。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.05738 以从此页面链接到该数据集。
引用此论文的 Space 0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.05738 以从此页面链接到该 Space。
包含此论文的收藏 0
暂无收藏包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接到该收藏。
相似文章
RelightFormer: 用于多视图物体重光照的前馈生成Transformer
RelightFormer 引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,使用交叉注意力进行光照注入和排列不变编码以处理无序视图,通过在大量合成数据集上训练实现最先进的视觉质量。
用于交互式和可微光照的 Neural Render Proxies
介绍了一种神经渲染代理(NRP),用于对固定相机和材质的静态场景进行可微重光照,达到交互速率,从而支持快速的基于梯度的逆工作流。
行走于隐空间:基于神经场景表示的交互式世界探索
NeuWorld 是一个新的交互式视频生成系统,它利用紧凑的神经隐式场景表示以及结合扩散变换器的变换器VAE,实现轨迹条件渲染,达到长时一致性。
RayDer:从真实世界视频中实现可扩展的自监督新颖视图合成
RayDer 是一个统一的前馈变换器,它将相机估计、场景重建和渲染整合到单一架构中,用于从真实世界视频进行自监督的新颖视图合成,实现了清晰的幂律扩展和强大的零样本性能。
Lite3R:一种高效的模型无关前馈3D重建框架
Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。