PanoWorld:真实世界全景生成
摘要
PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。
查看缓存全文
缓存时间: 2026/07/13 07:50
论文页面 - PanoWorld: 真实世界全景生成
来源:https://huggingface.co/papers/2607.09661
摘要
本文旨在通过利用全向表示的旋转等变性(旋转可视为隐式几何变换),解决全景世界模型中的长程记忆挑战。基于这一见解,我们提出了PanoWorld,该方法将相机轨迹简化为固定航向下的平移,并通过密集全景射线条件(DPRC)和几何感知记忆增强(GMA)分别处理当前动作建模与长程记忆。随后,引入三阶段训练流程逐步优化各组件。为了更好地评估大幅空间变化和多样光照条件下的物理一致性(现有数据集相对稳定),我们构建了World360,一个大规模数据集,包含通过全景无人机采集的真实世界视频片段以及由AirSim360生成的高质量模拟片段。在World360上的大量实验证明了PanoWorld的有效性,其性能大幅超越其他方法。我们的模型、训练代码和数据集将公开提供。更多信息请访问项目页面:https://lihaoy-ux.github.io/panoworld-page/。
查看 arXiv 页面 (https://arxiv.org/abs/2607.09661)查看 PDF (https://arxiv.org/pdf/2607.09661)项目页面 (https://lihaoy-ux.github.io/panoworld-page/)GitHub2 (https://github.com/Insta360-Research-Team/PanoWorld)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09661)
在您的 agent 中获取此论文:
hf papers read 2607.09661
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
Insta360-Research/PanoWorld 更新于约 6 小时前 • 1 (https://huggingface.co/Insta360-Research/PanoWorld)
引用此论文的数据集0
无数据集链接此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2607.09661,以在此页面建立链接。
引用此论文的 Spaces0
无 Space 链接此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2607.09661,以在此页面建立链接。
包含此论文的收藏集0
无收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,以在此页面建立链接。
相似文章
PanoWorld: 迈向360度全景世界中的空间超感知
PanoWorld引入了球形空间交叉注意力机制用于全景推理,解决了多模态大语言模型在360度空间理解中的局限性。它构建了一个大规模管线用于几何感知监督,并提出一个诊断性基准,在多个基准上取得了最先进的结果。
通过几何感知预训练增强上下文全景生成
Canvas360是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,通过大规模数据集和新颖的建模技术,提升了几何一致性与全局连贯性。
基于多视角基础模型的统一全景几何估计
PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。
MoVerse: 实时视频世界建模与全景高斯脚手架
MoVerse 通过创建360°全景图和3D高斯脚手架,从单张图像生成实时交互式视频,利用基于扩散的技术实现高效渲染。
SpheRoPE:基于球形RoPE的零样本无优化360度全景生成
本文介绍了SpheRoPE,一个零样本且无需优化的框架,它将球形先验注入预训练的扩散变换器中,用于生成360度全景图像和视频,无需重新训练即可克服拓扑约束。