DeformSmith:物理引导分层生成用于机器人操作的可变形资产
摘要
DeformSmith是一个框架,用于从文本或图像生成交互式、物理可信的可变形资产,通过物理引导的分层生成来提高质量和可信度。
查看缓存全文
缓存时间: 2026/09/21 03:18
论文页面 - DeformSmith:面向机器人操作的可变形资产物理约束引导式层级生成
来源:https://huggingface.co/papers/2609.18620 发布于 9月17日
·
由https://huggingface.co/Canlee提交
Can Li (https://huggingface.co/Canlee) 于 9月21日
摘要
为机器人操作创建可变形资产需要同时定义其几何形状、外观和物理属性。这对可变形物体尤其具有挑战性,因为文本和图像对于物体如何变形以及响应接触所提供的信息有限,然而这些响应直接影响其是否适合交互。因此,自动化生成需要解决耦合的物理需求,并利用交互证据来引导构建和优化。我们提出了DeformSmith,一个能够从文本或单张图像自动生成可交互、物理可信的可变形资产的框架。通过层级智能体构建和共享的物理约束工件,该框架渐进式地构建、测试并优化几何形状、物理模型、材料行为以及机器人交互,直至生成的资产准备好用于模拟和操作。机器人交互通过操作反馈和可重放的交互数据,闭环地完成了生成过程。结果表明,DeformSmith生成的资产在视觉质量和物理合理性上优于现有最优基准方法,包括PhysGen3D、PhysGM和PhysX-Omni,同时支持合成用于机器人可变形物体操作的数据。项目页面:https://can-lee.github.io/deformsmith-web/
查看arXiv页面 (https://arxiv.org/abs/2609.18620) 查看PDF (https://arxiv.org/pdf/2609.18620) 项目页面 (https://can-lee.github.io/deformsmith-web/) GitHub (https://github.com/CAN-Lee/DeformSmith) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.18620)
在你的智能体中获取这篇论文:
hf papers read 2609\.18620
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.18620以从此页面链接它。
引用此论文的数据集 0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.18620以从此页面链接它。
引用此论文的Space 0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.18620以从此页面链接它。
包含此论文的收藏 0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
PhysisForcing:面向机器人操作的物理增强世界模拟器
PhysisForcing 是一种训练框架,通过基于 DiT 架构的像素级轨迹对齐和语义级关系对齐损失来强制物理一致性,从而增强机器人操作的具身视频生成,在基准测试上取得了显著改进。
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
PhysForge:为交互式虚拟世界生成具备物理基础的 3D 资产
PhysForge 是一个两阶段框架,能够生成具备物理基础和运动学参数的交互式 3D 资产,解决了虚拟世界中静态几何模型带来的瓶颈问题。
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
Deform360:面向可变形世界模型的大规模多视角视触觉数据集
Deform360是一个大规模视触觉数据集,包含198个物体、超过215小时的观测数据,用于研究可变形物体动力学,支持在机器人操作中比较2D视频与3D粒子世界模型。