Puffin-World:通过原生3D世界状态扩展统一多模态模型
摘要
Puffin-World 是一个统一多模态框架,通过 Omni-Camera 表示法整合物理理解、空间模拟和3D世界生成,并使用 Puffin-16M 数据集进行扩展。
查看缓存全文
缓存时间: 2026/09/04 07:57
论文页面 - Puffin-World:通过原生3D世界状态扩展统一多模态模型
来源:https://huggingface.co/papers/2609.04196
摘要
Puffin-World 是一个统一的多模态框架,它对物理、几何和外观进行联合建模,以实现物理一致的3D世界生成、重建与闭环探索。
我们提出了 Puffin-World,一种统一的多模态架构 (https://huggingface.co/papers?q=multimodal%20architecture),它集成了物理理解 (https://huggingface.co/papers?q=physical%20understanding)、空间模拟 (https://huggingface.co/papers?q=spatial%20simulation) 与 3D 世界生成 (https://huggingface.co/papers?q=3D%20world%20generation) 和重建能力,且不依赖外部的离线模块。为可靠地构建和与3D世界交互,我们的框架联合建模了三种原生的世界状态:物理(引力场 (https://huggingface.co/papers?q=gravity%20field) 与经纬度)、几何(深度 (https://huggingface.co/papers?q=depth))和外观(图像),并配以一个统一的全能相机表示 (https://huggingface.co/papers?q=Omni-Camera%20representation),该表示支持多样化的任务和灵活的运动。除了建模这些状态,我们还引入了一种在后续帧间传播物理动力学的策略。通过将绝对相机属性建立在现实世界的基础上,Puffin-World 实现了物理一致且视觉稳定的生成。我们进一步将外观与几何耦合在单一的生成过程 (https://huggingface.co/papers?q=generative%20process) 中,共同合成每一个未来视图并重建其底层几何。这种统一的范式使得需要多任务协同的交错式闭环应用成为可能,例如模仿世界探索和自校准世界探索。为了将 Puffin-World 扩展到复杂场景,我们构建了 Puffin-16M,该数据集包含 1500 万个视觉-语言-相机三元组 (https://huggingface.co/papers?q=vision-language-camera%20triplets) 和 100 万条包含各种挑战性运动的轨迹。为促进该领域的进一步研究,我们已开源了代码、模型和数据集。
查看 arXiv 页面 (https://arxiv.org/abs/2609.04196)查看 PDF (https://arxiv.org/pdf/2609.04196)项目页面 (https://kangliao929.github.io/projects/puffin-world/)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04196)
在您的代理中获取此论文:
hf papers read 2609.04196
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
ACERobotics/Puffin-World Image-to-3D• 约3小时前更新 • 8 (https://huggingface.co/ACERobotics/Puffin-World)
引用此论文的数据集1
KangLiao/Puffin-16M Preview• 约3小时前更新 • 887 • 8 (https://huggingface.co/datasets/KangLiao/Puffin-16M)
引用此论文的 Spaces1
包含此论文的合集1
相似文章
Cosmos 3: 用于物理AI的全模态世界模型
Cosmos 3是NVIDIA推出的一系列全模态世界模型,采用统一的混合Transformer架构联合处理语言、图像、视频、音频和动作序列,在物理AI的理解和生成任务上达到了最先进水平。
Pelican-Sim 1.0:面向具身智能的通用世界模型模拟器
Pelican-Sim 1.0是一款面向具身智能的通用世界模型模拟器,能够从视觉上下文和机器人动作中预测未来观测结果,并通过关键设计提升跨多样具身体和任务的可控性与视频质量。
PixWorld:在像素空间中统一3D场景生成与重建
PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。
PanoWorld:真实世界全景生成
PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。
面向进化环境中具身智能体的多尺度世界模型混合
本文介绍了MuSix,一个面向具身智能体的框架,通过尺度感知的世界模型混合与进化机制,处理进化环境中的多尺度推理与动态适应,在EmbodiedBench和HAZARD上相比基线方法取得了改进。