无需训练的多模态大语言模型密集手部接触估计

Hugging Face Daily Papers 论文

摘要

本文提出ContactPrompt,一种利用多模态大语言模型进行密集手部接触估计的免训练零样本方法,无需训练即优于监督方法。

密集手部接触估计既需要高层语义理解,又需要对人机交互进行细粒度几何推理,以准确定位接触区域。近来,多模态大语言模型(MLLMs)借助从大规模数据中学到的视觉-语言先验知识,展现出了强大的视觉语义理解能力。然而,利用 MLLMs 进行密集手部接触估计仍处于探索不足的状态。将 MLLMs 应用于密集手部接触估计面临两大挑战。首先,编码显式的三维手部几何形状十分困难,因为 MLLMs 主要基于视觉和语言模态运行。其次,捕捉细粒度的顶点级接触依然具有挑战性,因为 MLLMs 倾向于关注高层语义,而非细致的几何推理。为应对这些挑战,我们提出 ContactPrompt,这是一种利用 MLLMs 进行密集手部接触估计的免训练零样本方法。为有效编码三维手部几何,我们引入了一种详细的手部部位分割以及一种分部位的顶点网格表示,提供结构化的局部几何信息。为实现准确高效的密集接触预测,我们设计了一种带部位条件的多阶段结构化接触推理,逐步衔接全局语义与细粒度几何。因此,我们的方法有效发挥了 MLLMs 的推理能力,同时实现了精准的密集手部接触估计。令人惊讶的是,所提出的方法无需任何训练,即在性能上超越了此前在大规模密集接触数据集上训练的监督方法。代码将予以发布。
查看原文
查看缓存全文

缓存时间: 2026/05/12 10:52

论文页面 - 基于多模态大语言模型的免训练密集手部接触估计

来源:https://huggingface.co/papers/2605.05886

摘要

ContactPrompt 通过结构化的三维手部几何编码与多阶段接触推理,利用多模态大语言模型实现了零样本密集手部接触估计。

密集手部接触估计 (https://huggingface.co/papers?q=Dense%20hand%20contact%20estimation) 需要同时具备对人类交互的高层语义理解与细粒度几何推理能力,以准确定位接触区域。近年来,多模态大语言模型 (https://huggingface.co/papers?q=multi-modal%20large%20language%20models) (MLLMs) 展现出强大的视觉语义理解能力,这得益于其从大规模数据中学习到的视觉-语言先验 (https://huggingface.co/papers?q=vision-language%20priors)。然而,将 MLLMs 应用于密集手部接触估计 (https://huggingface.co/papers?q=dense%20hand%20contact%20estimation) 的研究仍相对匮乏。在将该方法应用于密集手部接触估计 (https://huggingface.co/papers?q=dense%20hand%20contact%20estimation) 时面临两大主要挑战:首先,由于 MLLMs 主要处理视觉和语言模态,对显式三维手部几何进行编码较为困难;其次,捕捉细粒度的顶点级接触仍然具有挑战性,因为 MLLMs 往往侧重于高层语义而非详细的几何推理。为应对这些挑战,我们提出了 ContactPrompt,一种基于 MLLMs 的免训练、零样本密集手部接触估计 (https://huggingface.co/papers?q=dense%20hand%20contact%20estimation) 方法。为了有效编码三维手部几何,我们引入了详细的手部部件分割 (https://huggingface.co/papers?q=hand-part%20segmentation) 以及逐部件顶点网格表示 (https://huggingface.co/papers?q=vertex-grid%20representation),从而提供结构化、局部化的几何信息。为实现准确高效的密集接触预测,我们开发了一种带有部件条件控制 (https://huggingface.co/papers?q=part%20conditioning) 的多阶段结构化接触推理 (https://huggingface.co/papers?q=multi-stage%20structured%20contact%20reasoning) 机制,逐步衔接全局语义与细粒度几何特征。因此,我们的方法有效利用了 MLLMs 的推理能力,同时实现了精确的密集手部接触估计 (https://huggingface.co/papers?q=dense%20hand%20contact%20estimation)。令人惊讶的是,该方法在未进行任何训练的情况下,性能超越了此前在大规模密集接触数据集上训练的监督学习方法。代码将会开源发布。

查看 arXiv 页面 (https://arxiv.org/abs/2605.05886) 查看 PDF (https://arxiv.org/pdf/2605.05886) 项目主页 (https://contactprompt-release.github.io/) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2605.05886)

在您的 Agent 中使用本文:

hf papers read 2605.05886

尚未安装最新版的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash 进行安装

引用该论文的模型 0

暂无链接此论文的模型

请在模型的 README.md 中引用 arxiv.org/abs/2605.05886,以便从此页面进行链接。

引用该论文的数据集 0

暂无链接此论文的数据集

请在数据集的 README.md 中引用 arxiv.org/abs/2605.05886,以便从此页面进行链接。

引用该论文的 Spaces 0

暂无链接此论文的 Space

请在 Space 的 README.md 中引用 arxiv.org/abs/2605.05886,以便从此页面进行链接。

收录该论文的合集 0

暂无收录此论文的合集

将此论文添加至一个新合集 (https://huggingface.co/new-collection) 以在此页面显示链接。

相似文章