FAMOS:基于稀疏观测的前馈三维关节建模
摘要
FAMOS 是一个前馈模型,它使用多状态关节变换器和程序化数据生成器,从稀疏点云中预测可移动部分分割和关节参数,在实验中显示出相比基线方法的一致性改进。
查看缓存全文
缓存时间: 2026/09/18 11:01
论文页面 - FAMOS:基于稀疏观测的前馈式三维铰接物体建模
来源:https://huggingface.co/papers/2609.20817
摘要
从稀疏单目视角建模铰接物体颇具挑战,因为每次观测仅能揭示部分几何结构和运动证据。大多数前馈式方法从单次观测推断关节结构,因而严重依赖于学习到的类别级形状先验。我们提出FAMOS——一个前馈式模型,能从稀疏、无序的部分点云集合中预测可移动部件分割与关节参数。该模型联合推理多个观测输入,并天然支持可变数量的输入(包括单视图)。为聚合跨观测的关节信息,我们引入了多状态关节Transformer,采用交替的逐状态与全局注意力机制。我们进一步提出观测关节跨度目标,监督每个部件在输入观测中展现的运动范围,鼓励模型利用完整的观测集。为克服现有数据集规模与多样性有限的难题,我们设计了程序化数据生成器,在训练期间合成带自标注的资产。在PartNet-Mobility、ACD和ArtiCraft-10K上的实验表明,本方法相比前馈式与基于优化的基线模型均能带来持续性能提升。项目页面:https://kevinqu7.github.io/famos
查看arXiv页面 (https://arxiv.org/abs/2609.20817) 查看PDF (https://arxiv.org/pdf/2609.20817) 项目主页 (https://kevinqu7.github.io/famos/) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.20817)
通过您的代理获取此论文:
hf papers read 2609.20817
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型链接此论文 在模型README.md中引用 arxiv.org/abs/2609.20817 以从本页面建立链接
引用此论文的数据集 0
暂无数据集链接此论文 在数据集README.md中引用 arxiv.org/abs/2609.20817 以从本页面建立链接
引用此论文的Spaces 0
暂无Space链接此论文 在Space README.md中引用 arxiv.org/abs/2609.20817 以从本页面建立链接
包含此论文的收藏 0
暂无收藏包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面建立链接。
相似文章
基于静止状态观察的铰接物体重建
本文介绍了一种静止状态框架,该框架从单个闭合配置中重建铰接物体,利用显式网格、视觉-语言输出和视频扩散模型来生成并验证关节假设,而无需观测运动。
AnyMo:基于掩码建模的任意模态条件运动生成扩展
本文提出AnyMo,一种统一的多模态人体运动生成框架,结合基于残差FSQ的运动分词器与可扩展的掩码建模Transformer,并利用包含超过5000小时运动数据的OmniHuMo数据集,实现在任意模态组合下的高质量合成。
Lite3R:一种高效的模型无关前馈3D重建框架
Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。
FFAvatar: 少样本、前馈、可泛化的头像重建
FFAvatar提出了一种前馈框架,能在数秒内从少量非摆拍图像中重建高质量、可动画的3D高斯头部头像,在NeRSemble基准测试上相比现有最优方法实现了5.5 PSNR的提升。
AFUN:迈向功能性理解的可供性基础模型
AFUN 提出了一种可供性基础模型,该模型从 RGB-D 观测和语言描述中预测功能掩码和 3D 运动曲线,从而能够在多种环境中实现泛化的机器人操作。该模型在多个基准测试上优于基线方法,并且无需微调即可部署到实际任务中。