Puffin-World:通过原生3D世界状态扩展统一多模态模型

Hugging Face Daily Papers 论文

摘要

Puffin-World 是一个统一多模态框架,通过 Omni-Camera 表示法整合物理理解、空间模拟和3D世界生成,并使用 Puffin-16M 数据集进行扩展。

我们提出 Puffin-World,一个统一多模态架构,整合物理理解、空间模拟和3D世界生成与重建,无需依赖外部离线模块。为了可靠地构建和与3D世界交互,我们的框架联合建模三个原生物理状态:物理(重力场和纬度)、几何(深度)和外观(图像),并结合统一的 Omni-Camera 表示法,支持多样任务和灵活运动。除了建模这些状态,我们还引入了一种策略,将物理动态传播到未来帧。通过将绝对相机属性基于现实世界,Puffin-World 实现了物理一致且视觉稳定的3D世界生成。我们进一步在单一生成过程中耦合外观和几何,共同合成每个未来视图并重建其底层几何结构。这种统一范式使得需要跨多个任务协同的交错闭环应用成为可能,包括模仿和自校准世界探索。为了将 Puffin-World 扩展到复杂场景,我们构建了 Puffin-16M,包含1500万视觉-语言-相机三元组和100万条轨迹,具有各种具有挑战性的运动。为了促进这一领域的进一步研究,我们发布了代码、模型和数据集。
查看原文
查看缓存全文

缓存时间: 2026/09/04 07:57

论文页面 - Puffin-World:通过原生3D世界状态扩展统一多模态模型

来源:https://huggingface.co/papers/2609.04196

摘要

Puffin-World 是一个统一的多模态框架,它对物理、几何和外观进行联合建模,以实现物理一致的3D世界生成、重建与闭环探索。

我们提出了 Puffin-World,一种统一的多模态架构 (https://huggingface.co/papers?q=multimodal%20architecture),它集成了物理理解 (https://huggingface.co/papers?q=physical%20understanding)、空间模拟 (https://huggingface.co/papers?q=spatial%20simulation) 与 3D 世界生成 (https://huggingface.co/papers?q=3D%20world%20generation) 和重建能力,且不依赖外部的离线模块。为可靠地构建和与3D世界交互,我们的框架联合建模了三种原生的世界状态:物理(引力场 (https://huggingface.co/papers?q=gravity%20field) 与经纬度)、几何(深度 (https://huggingface.co/papers?q=depth))和外观(图像),并配以一个统一的全能相机表示 (https://huggingface.co/papers?q=Omni-Camera%20representation),该表示支持多样化的任务和灵活的运动。除了建模这些状态,我们还引入了一种在后续帧间传播物理动力学的策略。通过将绝对相机属性建立在现实世界的基础上,Puffin-World 实现了物理一致且视觉稳定的生成。我们进一步将外观与几何耦合在单一的生成过程 (https://huggingface.co/papers?q=generative%20process) 中,共同合成每一个未来视图并重建其底层几何。这种统一的范式使得需要多任务协同的交错式闭环应用成为可能,例如模仿世界探索和自校准世界探索。为了将 Puffin-World 扩展到复杂场景,我们构建了 Puffin-16M,该数据集包含 1500 万个视觉-语言-相机三元组 (https://huggingface.co/papers?q=vision-language-camera%20triplets) 和 100 万条包含各种挑战性运动的轨迹。为促进该领域的进一步研究,我们已开源了代码、模型和数据集。

查看 arXiv 页面 (https://arxiv.org/abs/2609.04196)查看 PDF (https://arxiv.org/pdf/2609.04196)项目页面 (https://kangliao929.github.io/projects/puffin-world/)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04196)

在您的代理中获取此论文:

hf papers read 2609.04196

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型1

ACERobotics/Puffin-World Image-to-3D• 约3小时前更新 • 8 (https://huggingface.co/ACERobotics/Puffin-World)

引用此论文的数据集1

KangLiao/Puffin-16M Preview• 约3小时前更新 • 887 • 8 (https://huggingface.co/datasets/KangLiao/Puffin-16M)

引用此论文的 Spaces1

包含此论文的合集1

相似文章

Cosmos 3: 用于物理AI的全模态世界模型

Hugging Face Daily Papers

Cosmos 3是NVIDIA推出的一系列全模态世界模型,采用统一的混合Transformer架构联合处理语言、图像、视频、音频和动作序列,在物理AI的理解和生成任务上达到了最先进水平。

PixWorld:在像素空间中统一3D场景生成与重建

Hugging Face Daily Papers

PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。

PanoWorld:真实世界全景生成

Hugging Face Daily Papers

PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。