FAMOS:基于稀疏观测的前馈三维关节建模

Hugging Face Daily Papers 论文

摘要

FAMOS 是一个前馈模型,它使用多状态关节变换器和程序化数据生成器,从稀疏点云中预测可移动部分分割和关节参数,在实验中显示出相比基线方法的一致性改进。

从稀疏单目视角建模关节物体具有挑战性,因为每个观测仅揭示部分几何形状和运动证据。大多数前馈方法从单个观测推断关节性,因此严重依赖学习的类别级形状先验。我们提出 FAMOS,一个前馈模型,从稀疏、无序的部分点云集合中预测可移动部分分割和关节参数。我们的模型联合推理多个观测,并自然支持可变数量的输入,包括单个视图。为了聚合跨观测的关节线索,我们引入了一个多状态关节变换器,具有交替的状态级和全局注意力。我们进一步提出了一个观测关节跨度目标,监督每个部分在输入观测中展示的运动范围,鼓励模型利用完整的观测集。为了克服现有数据集的有限规模和多样性,我们引入了一个程序化数据生成器,在训练过程中合成自标注资产。在 PartNet-Mobility、ACD 和 ArtiCraft-10K 上的实验显示,相比前馈和基于优化的基线方法有一致性改进。项目页面:https://kevinqu7.github.io/famos
查看原文
查看缓存全文

缓存时间: 2026/09/18 11:01

论文页面 - FAMOS:基于稀疏观测的前馈式三维铰接物体建模

来源:https://huggingface.co/papers/2609.20817

摘要

从稀疏单目视角建模铰接物体颇具挑战,因为每次观测仅能揭示部分几何结构和运动证据。大多数前馈式方法从单次观测推断关节结构,因而严重依赖于学习到的类别级形状先验。我们提出FAMOS——一个前馈式模型,能从稀疏、无序的部分点云集合中预测可移动部件分割与关节参数。该模型联合推理多个观测输入,并天然支持可变数量的输入(包括单视图)。为聚合跨观测的关节信息,我们引入了多状态关节Transformer,采用交替的逐状态与全局注意力机制。我们进一步提出观测关节跨度目标,监督每个部件在输入观测中展现的运动范围,鼓励模型利用完整的观测集。为克服现有数据集规模与多样性有限的难题,我们设计了程序化数据生成器,在训练期间合成带自标注的资产。在PartNet-Mobility、ACD和ArtiCraft-10K上的实验表明,本方法相比前馈式与基于优化的基线模型均能带来持续性能提升。项目页面:https://kevinqu7.github.io/famos

查看arXiv页面 (https://arxiv.org/abs/2609.20817) 查看PDF (https://arxiv.org/pdf/2609.20817) 项目主页 (https://kevinqu7.github.io/famos/) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.20817)

通过您的代理获取此论文: hf papers read 2609.20817 尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型链接此论文 在模型README.md中引用 arxiv.org/abs/2609.20817 以从本页面建立链接

引用此论文的数据集 0

暂无数据集链接此论文 在数据集README.md中引用 arxiv.org/abs/2609.20817 以从本页面建立链接

引用此论文的Spaces 0

暂无Space链接此论文 在Space README.md中引用 arxiv.org/abs/2609.20817 以从本页面建立链接

包含此论文的收藏 0

暂无收藏包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面建立链接。

相似文章

基于静止状态观察的铰接物体重建

Hugging Face Daily Papers

本文介绍了一种静止状态框架,该框架从单个闭合配置中重建铰接物体,利用显式网格、视觉-语言输出和视频扩散模型来生成并验证关节假设,而无需观测运动。

AnyMo:基于掩码建模的任意模态条件运动生成扩展

Hugging Face Daily Papers

本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。

Lite3R:一种高效的模型无关前馈3D重建框架

Hugging Face Daily Papers

Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。

FFAvatar: 少样本、前馈、可泛化的头像重建

Hugging Face Daily Papers

FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。

AFUN:迈向功能性理解的可供性基础模型

Hugging Face Daily Papers

AFUN 提出了一种可供性基础模型,该模型从 RGB-D 观测和语言描述中预测功能掩码和 3D 运动曲线,从而能够在多种环境中实现泛化的机器人操作。该模型在多个基准测试上优于基线方法,并且无需微调即可部署到实际任务中。