RayDer:从真实世界视频中实现可扩展的自监督新颖视图合成
摘要
RayDer 是一个统一的前馈变换器,它将相机估计、场景重建和渲染整合到单一架构中,用于从真实世界视频进行自监督的新颖视图合成,实现了清晰的幂律扩展和强大的零样本性能。
查看缓存全文
缓存时间: 2026/06/01 19:21
论文页面 - RayDer:从真实世界视频中可扩展的自监督新视角合成
来源:https://huggingface.co/papers/2605.31535
摘要
RayDer 是一个统一的前馈 Transformer,将相机估计、场景重建和渲染整合到单一主干网络中,用于自监督新视角合成。它通过动态状态吸收实现真实世界视频上的稳定训练,并展现出清晰的缩放行为。
自监督新视角合成(https://huggingface.co/papers?q=novel%20view%20synthesis)(NVS) 仍然难以扩展,尽管视频数据非常丰富,这主要归因于在真实视频上训练的脆弱性以及多网络系统设计中难以预测的缩放行为。我们提出了 RayDer,一个统一的前馈 Transformer(https://huggingface.co/papers?q=feed-forward%20transformer),它将相机估计(https://huggingface.co/papers?q=camera%20estimation)、场景重建(https://huggingface.co/papers?q=scene%20reconstruction)和渲染(https://huggingface.co/papers?q=rendering)整合到单一主干网络中,将自监督 NVS 转化为一个良定义的单一模型缩放问题。一个最小化的动态状态(https://huggingface.co/papers?q=dynamic%20state)被视为干扰因素,吸收随时间变化的内容,从而在无约束的真实世界视频上实现稳定训练。重要的是,RayDer 将静态场景 NVS 作为其目标任务:动态内容仅用作可扩展的监督信号,而不是像动态场景(4D)NVS 那样进行重建。在多种模型规模和跨越多个数量级的数据上,RayDer 展现出与数据和计算量相关的清晰幂律缩放(https://huggingface.co/papers?q=power-law%20scaling)特性,并且优于静态场景数据混合。在大量基准测试中,RayDer 取得了强大的零样本开放集性能(https://huggingface.co/papers?q=zero-shot%20open-set%20performance),可与最先进的有监督方法相媲美。项目页面:https://compvis.github.io/rayder
查看 arXiv 页面(https://arxiv.org/abs/2605.31535)查看 PDF(https://arxiv.org/pdf/2605.31535)项目页面(https://compvis.github.io/rayder/)GitHub1(https://github.com/CompVis/rayder)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.31535)
在您的代理中获取此论文:
hf papers read 2605\.31535
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
CompVis/rayder 图像到图像• 更新于16分钟前 • 2(https://huggingface.co/CompVis/rayder)
引用此论文的数据集0
没有引用此论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2605.31535,以在此页面链接该数据集。
引用此论文的 Spaces0
没有引用此论文的 Space
请在 Space README.md 中引用 arxiv.org/abs/2605.31535,以在此页面链接该 Space。
包含此论文的集合0
没有包含此论文的集合
请将此论文添加到一个集合(https://huggingface.co/new-collection)中,以在此页面链接该集合。
相似文章
UniWorld-View:基于视频扩散模型的大基线视图合成
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。
MetaView: 单目新视角合成与尺度感知的隐式几何先验
MetaView 提出了一种基于扩散的单目新视角合成框架,该框架结合了隐式几何先验与度量深度引导,能够在单张图像的大视角变化下实现一致且可控的渲染。
RelightFormer: 用于多视图物体重光照的前馈生成Transformer
RelightFormer 引入了一种前馈生成Transformer,用于直接单视图和多视图图像重光照,使用交叉注意力进行光照注入和排列不变编码以处理无序视图,通过在大量合成数据集上训练实现最先进的视觉质量。
DF3DV-1K:大规模无干扰新视角合成数据集与基准
介绍了DF3DV-1K,一个包含1048个场景和89924张图像的大规模真实世界数据集,用于无干扰的新视角合成,同时提供了九种方法的基准测试,以及通过微调基于扩散的2D增强器来改进辐射场方法的应用。
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。