SUFLECA:扩大特征学习以实现CAD到图像对齐
摘要
SUFLECA是一个弱监督框架,用于零样本CAD到图像对齐,通过从预训练视觉表示中扩大基于几何的特征学习,在ScanNet25k上实现了最先进的准确率。
查看缓存全文
缓存时间: 2026/07/20 09:41
论文页面 - SUFLECA:扩展特征学习以实现CAD到图像对齐
来源:https://huggingface.co/papers/2607.15058
摘要
CAD到图像对齐旨在从单张RGB图像中估计物体的9D姿态(旋转、平移和各向异性缩放),从而支持机器人技术和增强现实应用。最近的零样本方法利用视觉基础模型将图像区域与CAD模型进行匹配,但这些对应关系通常由外观驱动,在遮挡或仿真到现实域迁移下性能会下降。为解决这些局限性,我们提出了SUFLECA(Scaling Up Feature LEarning for CAD Alignment),这是一个用于零样本CAD对齐的弱监督框架,包含两项关键贡献。首先,SUFLECA通过归一化物体坐标(NOCs)监督,在涵盖12个真实和合成数据集的674K张图像上扩展了基于预训练视觉表示的几何驱动特征学习,学习到能够跨域泛化的紧凑几何感知特征。其次,我们提出了一种几何一致的匹配算法,能够建立可靠的一对一CAD到图像对应关系。综合这些贡献,该方法能够在无需迭代姿态优化的前提下,对每个物体实例实现精确、亚秒级的对齐。在ScanNet25k上,SUFLECA实现了33.4%/42.3%的类别/实例准确率,以更小的计算开销超越了最强零样本基线10.3/12.2个百分点,并且在该基准上首次超越了全监督方法。代码已开源:https://github.com/snt-arg/SUFLECA
查看arXiv页面 (https://arxiv.org/abs/2607.15058)查看PDF (https://arxiv.org/pdf/2607.15058)GitHub1 (https://github.com/snt-arg/SUFLECA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.15058)
在您的代理中获取此论文:
hf papers read 2607\.15058
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.15058以在此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2607.15058以在此页面链接它。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.15058以在此页面链接它。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)以在此页面链接它。
相似文章
SurGe:点地图中改进的表面几何
SurGe引入了一个Neighborhood Attention Decoder和一种重新制定的尺度不变梯度匹配损失,以改进前馈式3D重建中的局部表面几何精度,特别是对于薄结构。它在零样本单目几何基准测试中取得了最先进的平均排名,并在局部点图和法线度量方面表现更好。
GRASP: 面向可扩展预训练数据归因的几何感知残差对齐
GRASP 提出了一种几何感知、基于交互的可扩展预训练数据归因方法,该方法对子集动态进行建模,在任务级秩相关上比现有加性方法提升超过两倍,同时降低了计算成本。
FeatCal: 后合并模型的特征校准
FeatCal是一种校准方法,通过逐层权重更新(无需梯度下降)来缩小后合并模型的性能差距,在CLIP和GLUE基准测试上以高样本效率取得了优异结果。
跨尺度对齐监督训练GANs
本文提出CAT,一种跨尺度对齐变换器,通过强制中间GAN输出与最终输出之间的一致性来解决轨迹错位问题,在ImageNet-256上实现了1.56的最优FID。
FAST-GOAL: 快速高效的全局-局部对象对齐学习
FAST-GOAL 是一种微调方法,增强了CLIP在图像和长文本中对其全局和局部语义的能力,引入了FLISM和TSL模块以及GLIT100k数据集,在长标题数据集上取得了改进。