Hand Visibility Detector:手部关键点级可见性估计
摘要
本文介绍了 Hand Visibility Detector,一个专门用于手部关节级可见性估计的模型,并展示了其在通过可见性加权三角化进行多视角 3D 手部姿态标注中的优势。
查看缓存全文
缓存时间: 2026/08/13 15:33
论文页面 - Hand Visibility Detector:手部逐关键点可见性估计
Source: https://huggingface.co/papers/2608.11574
摘要
这项工作介绍了一个专门用于手部逐关节可见性估计的模型,并展示了它在多视角 3D 手部姿态标注中的价值。手部姿态估计 (https://huggingface.co/papers?q=Hand%20Pose%20Estimation)(HPE)是 AR/VR 和机器人等多种应用中的基础技术。在这些应用中,图像中每个手部关节的可见性对于评估遮挡情况下估计结果的可靠性至关重要。然而,大多数现有的 HPE 方法只输出关节点位置,并未明确指示其可见性。尽管有些方法考虑了遮挡或可见性,但可见性估计 (https://huggingface.co/papers?q=visibility%20estimation) 主要被用作改进姿态估计的辅助信号。据我们所知,手部逐关节可见性估计 (https://huggingface.co/papers?q=visibility%20estimation) 尚未作为独立任务被系统研究。在这项工作中,我们提出了 Hand Visibility Detector (https://huggingface.co/papers?q=Hand%20Visibility%20Detector)——一个用于估计单个手部关节可见性的模型,并首次对可见性估计 (https://huggingface.co/papers?q=visibility%20estimation) 作为独立任务进行了系统研究。我们表明,利用在大规模数据上预训练的 HPE 模型的先验知识作为骨干网络,可以在该任务中取得高性能。我们进一步展示了 Hand Visibility Detector (https://huggingface.co/papers?q=Hand%20Visibility%20Detector) 在通过 2D 关键点的多视角三角化 (https://huggingface.co/papers?q=multi-view%20triangulation) 进行 3D 手部姿态标注这一下游任务中的实用性,结果表明,基于可见性加权的三角化 (https://huggingface.co/papers?q=visibility-weighted%20triangulation) 能够降低重投影误差 (https://huggingface.co/papers?q=reprojection%20error)。我们的方法已作为开箱即用的工具包发布,代码和演示可在 https://github.com/ryhara/hand_visibility_detector 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.11574) 查看 PDF (https://arxiv.org/pdf/2608.11574) GitHub30 (https://github.com/ryhara/hand_visibility_detector) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11574)
将这篇论文获取到您的 agent 中:
hf papers read 2608\.11574
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 1
ryhara/hand-visibility-detector 关键点检测 • 约 14 小时前更新 • 1 (https://huggingface.co/ryhara/hand-visibility-detector)
引用此论文的数据集 0
没有关联此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2608.11574,即可从本页链接到它。
引用此论文的 Spaces 0
没有关联此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2608.11574,即可从本页链接到它。
包含此论文的收藏集 0
没有包含此论文的收藏集
将这篇论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页链接到它。
相似文章
视频扩散模型在手部运动重建中的惊人有效性
ViDiHand 利用预训练的视频扩散模型表示,直接从自我中心视频帧中重建4D手部运动,无需检测器或优化,在ARCTIC、HOT3D和HOI4D上优于现有方法。
无需训练的多模态大语言模型密集手部接触估计
本文提出ContactPrompt,一种利用多模态大语言模型进行密集手部接触估计的免训练零样本方法,无需训练即优于监督方法。
具身消歧的主动感知
本文提出一个用于具身目标消歧的主动感知框架,使用视觉语言模型基于累积的视觉证据和交互信息进行决策。真实机器人实验展示了其在结合物理观察和用户意图澄清方面的有效性。
PointDiT: 像素空间扩散用于单目几何估计
PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。
同一场景,两种深度:探索单目基础模型中的几何模糊性
引入MultiDepth-3k基准,用于评估单目深度基础模型中的深度层偏好,并展示拉普拉斯视觉提示(Laplacian Visual Prompting)可以改变报告的深度层,表明不同模型之间存在互补的几何假设。