通过几何感知预训练增强上下文全景生成
摘要
Canvas360是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,通过大规模数据集和新颖的建模技术,提升了几何一致性与全局连贯性。
查看缓存全文
缓存时间: 2026/07/10 10:10
论文页面 - 通过几何感知预训练增强上下文全景生成
来源:https://huggingface.co/papers/2607.08765
摘要
Canvas360 是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,包含大规模数据集和新型建模技术,旨在提升几何一致性和全局连贯性。
在这项工作中,我们提出了 Canvas360,一个用于上下文全景生成(https://huggingface.co/papers?q=in-context%20panoramic%20generation)的两阶段框架,它结合了几何感知预训练(https://huggingface.co/papers?q=geometry-aware%20pretraining)与下游任务特定微调(https://huggingface.co/papers?q=downstream%20task-specific%20fine-tuning)。为解决缺乏针对上下文全景任务的大规模高质量训练数据的问题,我们提出了 Canvas360Dataset,一个包含 100 万对高质量全景样本的数据集,用于风格迁移、修复、扩展和编辑,为多种上下文生成场景提供有效监督。在建模方面,Canvas360 通过并行深度生成(https://huggingface.co/papers?q=parallel%20depth%20generation)、速度圆形填充(https://huggingface.co/papers?q=velocity%20circular%20padding)和相似性损失正则化(https://huggingface.co/papers?q=similarity%20loss%20regularization)增强了文本到全景图的生成能力,使模型能够学习几何感知表征、捕捉物体形变细节,并提升几何一致性(https://huggingface.co/papers?q=geometric%20consistency)和全局连贯性(https://huggingface.co/papers?q=global%20coherence)。此外,凭借强大的全景先验知识,Canvas360 通过令牌级拼接(https://huggingface.co/papers?q=token-level%20concatenation)实现了一个统一的上下文全景生成(https://huggingface.co/papers?q=in-context%20panoramic%20generation)框架,支持多种下游任务,在任务覆盖率和建模灵活性上超越先前方法。大量实验表明,Canvas360 提升了全景图像保真度(https://huggingface.co/papers?q=panoramic%20image%20fidelity),在全景专用的 FAED 指标(https://huggingface.co/papers?q=panorama-specific%20FAED%20metric)上表现尤为出色,并在报告的定量评估中达到具有竞争力或领先的结果。更多信息请访问我们的项目页面:https://zry000.github.io/Canvas360/
查看 arXiv 页面 (https://arxiv.org/abs/2607.08765) 查看 PDF (https://arxiv.org/pdf/2607.08765) 项目页面 (https://zry000.github.io/Canvas360/) GitHub5 (https://github.com/Insta360-Research-Team/Canvas360) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.08765)
在您的 Agent 中获取此论文:
hf papers read 2607.08765
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.08765 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.08765 以从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.08765 以从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
PanoWorld:真实世界全景生成
PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。
基于多视角基础模型的统一全景几何估计
PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。
PanoWorld: 迈向360度全景世界中的空间超感知
PanoWorld引入了球形空间交叉注意力机制用于全景推理,解决了多模态大语言模型在360度空间理解中的局限性。它构建了一个大规模管线用于几何感知监督,并提出一个诊断性基准,在多个基准上取得了最先进的结果。
Pantheon360: 通过3D感知360度视频扩散驯服数字孪生生成
Pantheon360引入了一种3D感知360度视频扩散框架,该框架使用显式3D缓存来强制执行几何一致性,从而能够从稀疏360度输入中生成高保真数字孪生。
SpheRoPE:基于球形RoPE的零样本无优化360度全景生成
本文介绍了SpheRoPE,一个零样本且无需优化的框架,它将球形先验注入预训练的扩散变换器中,用于生成360度全景图像和视频,无需重新训练即可克服拓扑约束。