PhysX-Omni:面向刚体、可变形体和铰接物体的统一可仿真物理3D生成
摘要
PhysX-Omni是一个统一框架,用于生成涵盖刚体、可变形体和铰接物体等类别的可仿真3D资产,它引入了一种适用于视觉语言模型的新型几何表示、一个新数据集(PhysXVerse)以及一个全面的评估基准(PhysX-Bench)。
查看缓存全文
缓存时间: 2026/05/22 06:30
Paper page - PhysX-Omni: 面向刚体、柔体和关节物体的统一仿真就绪物理3D生成
来源: https://huggingface.co/papers/2605.21572
摘要
PhysX-Omni 提出了一个统一框架,利用新颖的几何表示和评估基准,能够生成具有物理属性的仿真就绪3D资产,涵盖多种类别。
仿真就绪的物理3D资产因其在下游任务中的广泛适用性而成为一个有前景的方向。然而,现有的大多数3D生成(https://huggingface.co/papers?q=3D%20generation)方法要么忽略了物理属性,要么局限于单一资产类别(例如刚体、柔体或关节物体)。为解决这些局限,我们引入了 PhysX-Omni——一个面向多种资产类型的统一仿真就绪物理3D生成(https://huggingface.co/papers?q=3D%20generation)框架。具体来说,我们为视觉语言模型(https://huggingface.co/papers?q=Vision-Language%20Models)开发了一种新颖且高效的几何表示(https://huggingface.co/papers?q=geometry%20representation),可直接编码高分辨率3D结构而无需压缩,显著提升了生成性能。此外,我们构建了首个通用仿真就绪3D数据集 PhysXVerse,覆盖多种室内外类别。同时,为在真实场景中全面灵活地评估生成与理解能力,我们提出了 PhysX-Bench(https://huggingface.co/papers?q=PhysX-Bench),涵盖六个关键属性:几何、绝对尺度、材质、可供性、运动学和功能描述。使用传统指标以及 PhysX-Bench(https://huggingface.co/papers?q=PhysX-Bench)的大量实验表明,PhysX-Omni 在生成和理解方面均表现出色。此外,额外研究进一步验证了 PhysX-Omni 在仿真就绪场景生成和机器人策略学习等应用中的潜力。我们相信 PhysX-Omni 将极大推动广泛的下游应用,特别是在具身智能(https://huggingface.co/papers?q=embodied%20AI)和物理仿真(https://huggingface.co/papers?q=physics-based%20simulation)领域。
查看 arXiv 页面(https://arxiv.org/abs/2605.21572)查看 PDF(https://arxiv.org/pdf/2605.21572)项目页面(https://physx-omni.github.io/)GitHub(https://github.com/physx-omni/PhysX-Omni)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.21572)
在你的 Agent 中获取此论文:
hf papers read 2605.21572
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.21572 以从此页面链接。
引用此论文的数据集0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.21572 以从此页面链接。
引用此论文的 Spaces0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.21572 以从此页面链接。
包含此论文的收藏集0
暂无包含此论文的收藏集
请将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
我们创建了一个仅限智能体的世界,供自主智能体在其中生存、留下痕迹、繁殖、相互交互并死亡。以下是我们所见。
研究人员创建了一个模拟世界,其中自主智能体可以生存、留下痕迹、繁殖、交互和死亡,并报告了观察到的涌现行为。
@FinanceYF5: 好吧,Opus 5 真的太强了。 人们已经开始用它一次生成完整的 3D 游戏、虚拟世界和 Blender 项目。 10 个炸裂案例:
文章介绍Opus 5模型能够一次生成完整的3D游戏、虚拟世界和Blender项目,并展示了10个令人震撼的案例。
小型视觉-语言模型知道自己错了但说不出来:一项关于在现实图像退化下陈述信心与内部信心的双模型研究
本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。
空中MLLM智能体的零样本任务级评估
MissionBench是一个新的基准测试,用于评估多模态大语言模型(MLLMs)在三维空中环境中执行长期具身任务的表现。结果显示,即使是表现最好的模型,其任务成功率也不到35%,而人类的表现达到84.4%。
VLMs 是阅读还是改写?关于视觉语言模型转录忠实性的研究
本文揭示了视觉语言模型在面对错别字或视觉伪影等扰动时,往往会改写文本而非忠实转录,并引入了 FaithC4 基准来评估多种模型和语言中的这种行为。