三维场景交互理解的几何与语义耦合
摘要
本文介绍了Segment-Snap,一种结合几何与语义线索的方法,以提升三维场景中的交互理解,在运动门控AP和手柄检测指标上取得了显著提升。
查看缓存全文
缓存时间: 2026/09/23 03:30
论文页面 - 3D场景交互理解中的几何与语义耦合
来源:https://huggingface.co/papers/2609.25247 发布于 9月21日
·
提交者:https://huggingface.co/imsuperkong
Kong (https://huggingface.co/imsuperkong) 于9月23日
摘要
3D场景中的交互理解需要对可移动部件、其运动以及可操作区域进行联合描述。我们提出了Segment-Snap,它通过部件与操作把手之间的物理关系将这些输出连接起来。学习到的预测器能够识别大的部件表面和小的操作把手。几何解码器利用平面和直立先验来约束运动,然后根据预测的把手位置选择铰链线,无需训练运动回归器。反过来,一个联合的部件和把手预测器提供了额外的候选把手,其运动类别通过包含它们的部件进行细化。每次信息传递只应用一次,无需迭代反馈。在Articulate3D验证集上,把手引导将固定掩码和轴条件下的运动门控AP从13.74%提升至40.98%。额外的候选把手将把手AP从24.63%提高到29.65%;基于部件的类别校正增加了0.98个百分点,而完整的上下文达到了30.99%。通过重复训练、学习到的解码器控制以及配对可视化,我们确立了结合几何和语义证据进行交互理解的优势与局限。
查看 arXiv 页面 (https://arxiv.org/abs/2609.25247) 查看 PDF (https://arxiv.org/pdf/2609.25247) 项目主页 (https://hyokong.github.io/segment-snap-page/) GitHub1 (https://github.com/HyoKong/Segment-Snap) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.25247)
在你的智能体中获取此论文:
hf papers read 2609\.25247
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.25247 以从此页面链接它。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.25247 以从此页面链接它。
引用此论文的 Spaces 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.25247 以从此页面链接它。
包含此论文的收藏 0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
几何至关重要:用于学习语义对应的3D基础先验
本文介绍了一个后训练框架,利用SAM3D的3D先验来改进2D基础特征中的语义对应,解决了左右混淆和重复部分等问题。该方法使用实例特定的3D重建,无需姿态注释或球面几何捷径。
同一场景,两种深度:探索单目基础模型中的几何模糊性
引入MultiDepth-3k基准,用于评估单目深度基础模型中的深度层偏好,并展示拉普拉斯视觉提示(Laplacian Visual Prompting)可以改变报告的深度层,表明不同模型之间存在互补的几何假设。
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
SAM 3: Segment Anything with Concepts
SAM 3 引入了一个统一的模型,用于基于提示的概念分割与跟踪,通过解耦的识别与定位架构以及可扩展的数据引擎,实现了最先进的性能。
从视频中学习几何表征以赋予多模态大语言模型空间智能
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。