无需训练的多模态大语言模型密集手部接触估计
摘要
本文提出ContactPrompt,一种利用多模态大语言模型进行密集手部接触估计的免训练零样本方法,无需训练即优于监督方法。
查看缓存全文
缓存时间: 2026/05/12 10:52
论文页面 - 基于多模态大语言模型的免训练密集手部接触估计
来源:https://huggingface.co/papers/2605.05886
摘要
ContactPrompt 通过结构化的三维手部几何编码与多阶段接触推理,利用多模态大语言模型实现了零样本密集手部接触估计。
密集手部接触估计 (https://huggingface.co/papers?q=Dense%20hand%20contact%20estimation) 需要同时具备对人类交互的高层语义理解与细粒度几何推理能力,以准确定位接触区域。近年来,多模态大语言模型 (https://huggingface.co/papers?q=multi-modal%20large%20language%20models) (MLLMs) 展现出强大的视觉语义理解能力,这得益于其从大规模数据中学习到的视觉-语言先验 (https://huggingface.co/papers?q=vision-language%20priors)。然而,将 MLLMs 应用于密集手部接触估计 (https://huggingface.co/papers?q=dense%20hand%20contact%20estimation) 的研究仍相对匮乏。在将该方法应用于密集手部接触估计 (https://huggingface.co/papers?q=dense%20hand%20contact%20estimation) 时面临两大主要挑战:首先,由于 MLLMs 主要处理视觉和语言模态,对显式三维手部几何进行编码较为困难;其次,捕捉细粒度的顶点级接触仍然具有挑战性,因为 MLLMs 往往侧重于高层语义而非详细的几何推理。为应对这些挑战,我们提出了 ContactPrompt,一种基于 MLLMs 的免训练、零样本密集手部接触估计 (https://huggingface.co/papers?q=dense%20hand%20contact%20estimation) 方法。为了有效编码三维手部几何,我们引入了详细的手部部件分割 (https://huggingface.co/papers?q=hand-part%20segmentation) 以及逐部件顶点网格表示 (https://huggingface.co/papers?q=vertex-grid%20representation),从而提供结构化、局部化的几何信息。为实现准确高效的密集接触预测,我们开发了一种带有部件条件控制 (https://huggingface.co/papers?q=part%20conditioning) 的多阶段结构化接触推理 (https://huggingface.co/papers?q=multi-stage%20structured%20contact%20reasoning) 机制,逐步衔接全局语义与细粒度几何特征。因此,我们的方法有效利用了 MLLMs 的推理能力,同时实现了精确的密集手部接触估计 (https://huggingface.co/papers?q=dense%20hand%20contact%20estimation)。令人惊讶的是,该方法在未进行任何训练的情况下,性能超越了此前在大规模密集接触数据集上训练的监督学习方法。代码将会开源发布。
查看 arXiv 页面 (https://arxiv.org/abs/2605.05886) 查看 PDF (https://arxiv.org/pdf/2605.05886) 项目主页 (https://contactprompt-release.github.io/) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2605.05886)
在您的 Agent 中使用本文:
hf papers read 2605.05886
尚未安装最新版的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash 进行安装
引用该论文的模型 0
暂无链接此论文的模型
请在模型的 README.md 中引用 arxiv.org/abs/2605.05886,以便从此页面进行链接。
引用该论文的数据集 0
暂无链接此论文的数据集
请在数据集的 README.md 中引用 arxiv.org/abs/2605.05886,以便从此页面进行链接。
引用该论文的 Spaces 0
暂无链接此论文的 Space
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.05886,以便从此页面进行链接。
收录该论文的合集 0
暂无收录此论文的合集
将此论文添加至一个新合集 (https://huggingface.co/new-collection) 以在此页面显示链接。
相似文章
SLAPBench:面向四指SLAP指纹验证的多模态大语言模型基准测试
介绍SLAPBench,这是首个用于评估多模态大语言模型在四指SLAP指纹验证上的基准测试,研究发现提示策略和模型能力对性能有显著影响。
PromptNCE: 仅使用大语言模型和对比估计提示的点互信息预测
本文介绍了PromptNCE,一种使用大语言模型和对比提示来零样本估计点互信息的方法,在三个数据集上实现了与人类标注真实值的高度相关性。
低成本概念级局部解释:无训练方法能走多远?
本文评估了多模态大语言模型(MLLMs)在图像局部概念命名中的零样本能力,提出了一种可复现的评估协议,在无训练的情况下实现了62-88%的对象级准确率。
N_0-VTLA:利用潜在触觉标记扩展视觉-触觉-语言-动作模型
介绍了N_0-VTLA,一种面向高接触操作的视觉-触觉-语言-动作基础模型,具备大规模触觉预训练和基于优势的离线策略改进功能,在真实机器人和仿真基准测试中表现优异。
使用基于查询的Transformer的多模态表面肌电手部手势识别用于假肢控制
本文介绍了EMG-CrossFormer,一种用于多模态sEMG手部手势识别的混合卷积-Transformer模型,通过交叉注意力融合sEMG和惯性信号,在NinaPro数据集上达到了最先进的准确率。