UniSHARP:通用锐利单目视图合成
摘要
UniSHARP 将 SHARP 扩展到通用单目视图合成,适用于多种相机系统(透视、鱼眼、全向),通过在全方位潜在空间中对齐图像,并结合特征空间和高斯空间的联合对齐。该方法在一个新基准测试上优于其他替代方法。
查看缓存全文
缓存时间: 2026/06/08 03:29
Paper page - UniSHARP:通用锐化单目视图合成
来源:https://huggingface.co/papers/2606.07514
摘要
UniSHARP 通过联合特征与高斯空间对齐,将图像对齐到统一的全方位潜在空间中,从而将 SHARP 扩展为适用于不同相机系统的通用单目渲染方法。
本文致力于扩展 SHARP(一种流行的照片级真实感视图合成方法,详见 https://huggingface.co/papers?q=photorealistic%20view%20synthesis),使其实现跨连续相机系统的通用单目渲染(https://huggingface.co/papers?q=universal%20monocular%20rendering),涵盖从传统透视相机到宽视场、鱼眼以及全方位全景设置。为了克服 SHARP 基于针孔模型的假设,我们的核心思想是将各种图像对齐到一个统一的全方位潜在空间(https://huggingface.co/papers?q=omnidirectional%20latent%20space)中。为此,我们提出 UniSHARP,它在特征空间和高斯空间中执行隐式对齐。具体而言,高斯基元(https://huggingface.co/papers?q=Gaussian%20primitives)按照射线和径向距离排列在一种基于射线的通用表示(https://huggingface.co/papers?q=ray-based%20universal%20representation)中,同时从受 UniK3D 启发的编码器(https://huggingface.co/papers?q=UniK3D-inspired%20encoders)中提取的 2D 语义特征和 3D 空间特征被联合解码,生成完整的高斯云(https://huggingface.co/papers?q=Gaussian%20cloud)。为了全面评估我们的方法,我们构建了一个覆盖多种场景下不同成像系统的基准测试。该基准测试进一步按视场角(FoV)分层,以实现对通用单目渲染(https://huggingface.co/papers?q=universal%20monocular%20rendering)任务的细粒度评估。在提出的基准测试上进行的大量实验证明了 UniSHARP 的有效性,其性能大幅优于其他方法。项目页面详见:https://insta360-research-team.github.io/Unisharp-website/
查看 arXiv 页面(https://arxiv.org/abs/2606.07514)查看 PDF(https://arxiv.org/pdf/2606.07514)项目页面(https://insta360-research-team.github.io/Unisharp-website/)GitHub9(https://github.com/Insta360-Research-Team/UniSHARP)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.07514)
在您的 agent 中获取本文:
hf papers read 2606.07514
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
暂无模型链接本文
请在模型 README.md 中引用 arxiv.org/abs/2606.07514 以从本页链接。
引用本文的数据集0
暂无数据集链接本文
请在数据集 README.md 中引用 arxiv.org/abs/2606.07514 以从本页链接。
引用本文的Space0
暂无 Space 链接本文
请在 Space README.md 中引用 arxiv.org/abs/2606.07514 以从本页链接。
包含本文的收藏0
暂无收藏包含本文
请将本文添加至收藏(https://huggingface.co/new-collection)以从本页链接。
相似文章
MetaView: 单目新视角合成与尺度感知的隐式几何先验
MetaView 提出了一种基于扩散的单目新视角合成框架,该框架结合了隐式几何先验与度量深度引导,能够在单张图像的大视角变化下实现一致且可控的渲染。
基于多视角基础模型的统一全景几何估计
PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。
HarmoHOI: 协调外观与3D运动的多视角手物交互合成
HarmoHOI是一个统一扩散框架,联合生成同步的多视角手物交互视频和全局对齐的3D点轨迹,在视觉质量、运动合理性和多视角几何一致性方面取得了最先进的性能。
UniverSat: 面向地球观测的分辨率与模态无关的Transformer
UniverSat 引入了一种用于Vision Transformers的Universal Patch Encoder,该编码器可以在不同地球观测数据类型上实现鲁棒的、传感器无关的空间特征提取,在分类和分割基准测试上取得了优秀结果。
RayDer:从真实世界视频中实现可扩展的自监督新颖视图合成
RayDer 是一个统一的前馈变换器,它将相机估计、场景重建和渲染整合到单一架构中,用于从真实世界视频进行自监督的新颖视图合成,实现了清晰的幂律扩展和强大的零样本性能。