PanoWorld:真实世界全景生成

Hugging Face Daily Papers 论文

摘要

PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。

在这项工作中,我们旨在通过利用全向表示的旋转等变特性来解决全景世界模型中的长程记忆难题,其中旋转可被视为一种隐式几何变换。基于这一见解,我们提出了PanoWorld,它将相机轨迹简化为通过固定航向进行的平移,以便对当前动作进行建模,并通过密集全景光线条件化(DPRC)和几何感知记忆增强(GMA)实现长程记忆。随后,引入了三阶段训练流程,逐步优化每个组件。为了更好地评估在大尺度空间变化和多样光照条件下的物理一致性(现有数据集相对稳定),我们构建了World360,这是一个大规模数据集,包含通过全景无人机收集的真实世界视频片段以及由AirSim360生成的高质量模拟片段。在World360上的大量实验证明了PanoWorld的有效性,它以大幅优势超越了其他方法。我们的模型、训练代码和数据集将公开发布。更多信息请参见项目页面:https://lihaoy-ux.github.io/panoworld-page/。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:50

论文页面 - PanoWorld: 真实世界全景生成

来源:https://huggingface.co/papers/2607.09661

摘要

本文旨在通过利用全向表示的旋转等变性(旋转可视为隐式几何变换),解决全景世界模型中的长程记忆挑战。基于这一见解,我们提出了PanoWorld,该方法将相机轨迹简化为固定航向下的平移,并通过密集全景射线条件(DPRC)和几何感知记忆增强(GMA)分别处理当前动作建模与长程记忆。随后,引入三阶段训练流程逐步优化各组件。为了更好地评估大幅空间变化和多样光照条件下的物理一致性(现有数据集相对稳定),我们构建了World360,一个大规模数据集,包含通过全景无人机采集的真实世界视频片段以及由AirSim360生成的高质量模拟片段。在World360上的大量实验证明了PanoWorld的有效性,其性能大幅超越其他方法。我们的模型、训练代码和数据集将公开提供。更多信息请访问项目页面:https://lihaoy-ux.github.io/panoworld-page/。

查看 arXiv 页面 (https://arxiv.org/abs/2607.09661)查看 PDF (https://arxiv.org/pdf/2607.09661)项目页面 (https://lihaoy-ux.github.io/panoworld-page/)GitHub2 (https://github.com/Insta360-Research-Team/PanoWorld)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09661)

在您的 agent 中获取此论文:

hf papers read 2607.09661

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

Insta360-Research/PanoWorld 更新于约 6 小时前 • 1 (https://huggingface.co/Insta360-Research/PanoWorld)

引用此论文的数据集0

无数据集链接此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2607.09661,以在此页面建立链接。

引用此论文的 Spaces0

无 Space 链接此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2607.09661,以在此页面建立链接。

包含此论文的收藏集0

无收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以在此页面建立链接。

相似文章

PanoWorld: 迈向360度全景世界中的空间超感知

Hugging Face Daily Papers

PanoWorld引入了球形空间交叉注意力机制用于全景推理,解决了多模态大语言模型在360度空间理解中的局限性。它构建了一个大规模管线用于几何感知监督,并提出一个诊断性基准,在多个基准上取得了最先进的结果。

通过几何感知预训练增强上下文全景生成

Hugging Face Daily Papers

Canvas360是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,通过大规模数据集和新颖的建模技术,提升了几何一致性与全局连贯性。

基于多视角基础模型的统一全景几何估计

Hugging Face Daily Papers

PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。