通过几何感知预训练增强上下文全景生成

Hugging Face Daily Papers 论文

摘要

Canvas360是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,通过大规模数据集和新颖的建模技术,提升了几何一致性与全局连贯性。

在这项工作中,我们提出了Canvas360,一个用于上下文全景生成的两阶段框架,它结合了几何感知预训练与下游任务特定的微调。为了解决缺乏针对上下文全景任务的大规模高质量训练数据的问题,我们提出了Canvas360Dataset,这是一个包含100万高质量配对全景样本的数据集,用于风格迁移、修复、外扩和编辑,从而在多种上下文生成场景中实现有效的监督。在建模方面,Canvas360通过并行深度生成、速度循环填充和相似性损失正则化增强了文本到全景的生成,使模型能够学习几何感知表示、捕捉物体变形细节,并提升几何一致性与全局连贯性。此外,凭借强大的全景先验知识,Canvas360实现了一个统一的上下文全景生成框架,通过令牌级拼接支持多样化的下游任务,在任务覆盖范围和建模灵活性上超越了先前的方法。大量实验表明,Canvas360提升了全景图像的保真度,在全景专用的FAED指标上表现尤为出色,并在报告的定量评估中取得了具有竞争力或领先的结果。更多信息请访问我们的项目页面:https://zry000.github.io/Canvas360/
查看原文
查看缓存全文

缓存时间: 2026/07/10 10:10

论文页面 - 通过几何感知预训练增强上下文全景生成

来源:https://huggingface.co/papers/2607.08765

摘要

Canvas360 是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,包含大规模数据集和新型建模技术,旨在提升几何一致性和全局连贯性。

在这项工作中,我们提出了 Canvas360,一个用于上下文全景生成(https://huggingface.co/papers?q=in-context%20panoramic%20generation)的两阶段框架,它结合了几何感知预训练(https://huggingface.co/papers?q=geometry-aware%20pretraining)与下游任务特定微调(https://huggingface.co/papers?q=downstream%20task-specific%20fine-tuning)。为解决缺乏针对上下文全景任务的大规模高质量训练数据的问题,我们提出了 Canvas360Dataset,一个包含 100 万对高质量全景样本的数据集,用于风格迁移、修复、扩展和编辑,为多种上下文生成场景提供有效监督。在建模方面,Canvas360 通过并行深度生成(https://huggingface.co/papers?q=parallel%20depth%20generation)、速度圆形填充(https://huggingface.co/papers?q=velocity%20circular%20padding)和相似性损失正则化(https://huggingface.co/papers?q=similarity%20loss%20regularization)增强了文本到全景图的生成能力,使模型能够学习几何感知表征、捕捉物体形变细节,并提升几何一致性(https://huggingface.co/papers?q=geometric%20consistency)和全局连贯性(https://huggingface.co/papers?q=global%20coherence)。此外,凭借强大的全景先验知识,Canvas360 通过令牌级拼接(https://huggingface.co/papers?q=token-level%20concatenation)实现了一个统一的上下文全景生成(https://huggingface.co/papers?q=in-context%20panoramic%20generation)框架,支持多种下游任务,在任务覆盖率和建模灵活性上超越先前方法。大量实验表明,Canvas360 提升了全景图像保真度(https://huggingface.co/papers?q=panoramic%20image%20fidelity),在全景专用的 FAED 指标(https://huggingface.co/papers?q=panorama-specific%20FAED%20metric)上表现尤为出色,并在报告的定量评估中达到具有竞争力或领先的结果。更多信息请访问我们的项目页面:https://zry000.github.io/Canvas360/

查看 arXiv 页面 (https://arxiv.org/abs/2607.08765) 查看 PDF (https://arxiv.org/pdf/2607.08765) 项目页面 (https://zry000.github.io/Canvas360/) GitHub5 (https://github.com/Insta360-Research-Team/Canvas360) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.08765)

在您的 Agent 中获取此论文:

hf papers read 2607.08765

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.08765 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.08765 以从此页面链接。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.08765 以从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

PanoWorld:真实世界全景生成

Hugging Face Daily Papers

PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。

基于多视角基础模型的统一全景几何估计

Hugging Face Daily Papers

PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。

PanoWorld: 迈向360度全景世界中的空间超感知

Hugging Face Daily Papers

PanoWorld引入了球形空间交叉注意力机制用于全景推理,解决了多模态大语言模型在360度空间理解中的局限性。它构建了一个大规模管线用于几何感知监督,并提出一个诊断性基准,在多个基准上取得了最先进的结果。