@Michael_J_Black: 今日ECCV: 走向野外自我中心3D手部-物体姿态估计, 展览厅海报: #70, 下午CEST, 海报环节…

X AI KOLs Timeline 论文

摘要

本文介绍了EPIC-Contact,一个用于3D手部-物体姿态估计的野外数据集,以及HOPformer,一个Transformer模型,能够从单张RGB图像联合预测手部和物体姿态。

今日ECCV: 走向野外自我中心3D手部-物体姿态估计, 展览厅海报: #70, 下午CEST, 海报环节2. * 在无约束、杂乱、遮挡的自我中心视频中进行3D手部-物体姿态估计 * EPIC-Contact,一个具有密集3D手部-物体接触的野外数据集 * HOPformer,一个基于强手部先验条件化物体姿态的Transformer模型,在单次前向传播中预测手部和物体。 共同作者: @Sid__Bansal, @zhifan_zhu , @sha2nk_t, @terry_jhzhao00, @dimadamen https://sid2697.github.io/epic-contact/
查看原文
查看缓存全文

缓存时间: 2026/09/10 12:20

今日 ECCV 会议: 面向野外自我中心视角的 3D 手-物体位姿估计,展览大厅海报:#70,下午(中欧夏令时),海报专场 2。

  • 在无约束、杂乱、遮挡的自我中心视角视频中进行 3D 手-物体位姿估计
  • EPIC-Contact,一个包含密集 3D 手-物体接触信息的野外数据集
  • HOPformer,一种基于强手部先验条件来预测物体位姿的 Transformer 模型,可在一次前向传播中同时预测双手和物体位姿。

共同作者:@Sid__Bansal, @zhifan_zhu, @sha2nk_t, @terry_jhzhao00, @dimadamen

https://sid2697.github.io/epic-contact/


面向野外自我中心视角的 3D 手-物体位姿估计

来源:https://sid2697.github.io/epic-contact/ EPIC-Contact + HOPformer

ECCV 2026 (https://eccv.ecva.net/Conferences/2026)

简而言之

我们研究在无约束、杂乱、遮挡的自我中心视角视频中的 3D 手-物体位姿估计问题。我们贡献了EPIC-Contact,一个包含密集 3D 手-物体接触信息的野外数据集,以及HOPformer,一个基于强手部先验条件预测物体位姿的 Transformer 模型,可在一次前向传播中同时预测双手和物体。

自我中心视角画面:真实厨房中,一只手在灶台上提起平底锅

RGB 画面 + 3D 网格

3D 几何结构

拖动查看标注的 3D 手-物体网格,该网格投影到 EPIC-Contact 的一帧中。面板可旋转已姿态化的手-物体网格。 **EPIC-Contact:野外环境下的 3D 手与物体数据。**每个单元格都是来自 EPIC-Kitchens 的自我中心视频片段,叠加了来自我们数据集的 3D 手(蓝色)和物体(橙色)网格,并对每个片段帧进行了标注。EPIC-Contact 涵盖了数千个片段,涉及杂乱厨房中九种日常物体,存在自然遮挡。 论文概览

超越实验室的手-物体位姿学习

迄今为止,手-物体交互的 3D 真值依赖于在无杂乱的实验室工作室中使用昂贵的动作捕捉设备,因此基于学习的方法难以泛化到日常视频。我们弥合了这两方面的差距:通过密集接触实现可扩展的野外监督,以及一个利用手部信息来推理物体的模型。

01### EPIC-Contact 数据集

一个野外自我中心视角数据集,包含约 2.3K 个片段和 62.3K 帧,构建自 EPIC-Kitchens (https://zhifanzhu.github.io/objects-aligned-with-hoi/),具有密集的、双向的 3D 手-物体接触对应关系和姿态化网格。接触引导标注使得无需动作捕捉工作室即可实现 3D 监督。

02### HOPformer 模型

一种端到端的 Transformer 模型,在单次前向传播中从一张 RGB 图像联合预测双手手部位姿、物体位姿和物体类别。交叉注意力解码器利用强姿态专业化手部先验来调节物体特征。

2.3K 个自我中心片段 62.3K 个标注帧 9 个物体类别 82.4% ARCTIC [email protected] 交互式探索器

逐个样本探索数据集

浏览选定的 EPIC-Contact 样本:手部接触、转移的物体接触、相机空间投影以及拟合的 3D 几何,所有内容均在浏览器中实时渲染。

正在加载样本…

未选择样本

手-物体网格直接从相机空间几何结构投影得到。

贡献 01 · EPIC-Contact 数据集

通过野外 3D 接触监督

训练和评估手-物体重建需要配对的图像与 3D 手和物体位姿。我们从 EPIC-Kitchens 的稳定抓握片段中收集了EPIC-Contact,标注了密集的双向 3D 手-物体接触对应关系,并将其转化为姿态化的 3D 网格,无需任何动作捕捉设备。

三阶段 EPIC-Contact 标注流程:在细分的 MANO 手上绘制接触顶点,通过区域接触轴将其转移到物体上以获得双向对应关系,并使用 EC-fit 拟合姿态化手-物体网格。标注流程。标注者(1)从一个稳定抓握片段中,在一个细分的 3,106 顶点 MANO 手上绘制接触(包括在自我中心视角中被遮挡的区域);(2)使用区域 2-DoF 接触轴(最多六次点击)将其转移到物体上,保留双向手-物体对应关系;(3)使用EC-fit (https://github.com/ZJHTerry18/ec-fit) 拟合姿态化的手部和物体网格。标注者间一致性为 κh= 0.61(手部)和 κo= 0.62(物体)。

标注

手工标注的接触,而非 MoCap

  1. 1绘制手部接触 在观看稳定抓握片段时,在一个细分的 MANO 手上标注细粒度的接触区域,包括自我中心视角中被遮挡的区域。
  2. 2转移到物体 区域 2-DoF 接触轴(拇指、手指、掌心)以最多 6 次点击将接触映射到物体上,保留双向对应关系。VLM 估计多自由度物体尺寸(0.94 cm MAE)。
  3. 3使用 EC-fit (https://github.com/ZJHTerry18/ec-fit) 拟合 采用多初始化优化,结合接触损失、遮挡感知掩码损失和穿透损失,生成姿态化网格;片段级别的位姿通过 WiLoR 手部运动传播。

B

难点所在

真实厨房,真实杂乱

EPIC-Contact 涵盖了杂乱的背景和自然的交互,其中物体可能很小、透明或严重遮挡。这些条件在受控的实验室环境中是不存在的。据我们所知,这是第一个将多样化交互与姿态化 3D 手-物体网格及密集接触配对的野外自我中心视角数据集。

2.3K 个稳定抓握片段 62.3K 个标注帧 9 个物体类别 双向手↔物体接触

**数据集构成。**2,272 个稳定抓握片段,涵盖九个物体类别。选择一个类别以查看代表性重建的手-物体网格及其帧。 贡献 02 · HOPformer

条件化物体的手部先验

基于学习的 3D 手部重建现已具备强大能力且对遮挡具有鲁棒性,但联合手-物体方法仍然落后。HOPformer 的关键思想是将专业的手部先验注入到物体特征中,使一个的估计能够为另一个提供信息,所有这些都在一次前向传播中完成(约 107 毫秒/帧,比优化方法快几个数量级)。

HOPformer 架构:对象编码器和手部编码器生成令牌,这些令牌被投影并传递给一个 L 层 Transformer 解码器,该解码器具有自注意力、手-物体交叉注意力和前馈层,随后是一个聚合模块,将特征路由到用于双手和物体的位姿预测头,以及一个物体分类器,从模型池中检索网格。**HOPformer 概览。**通用 DINOv2 (ViT-G) 对象令牌通过一个 12 层解码器,在姿态专业化 WiLoR 手部令牌的条件下进行调制。每一层应用自注意力、手-物体交叉注意力和前馈网络;然后一个聚合模块将交互特征路由到用于双手和物体的专用头。→

架构

交叉注意力解码器

对象查询在 12 个解码器层中迭代地关注手部上下文,逐步根据手部姿态调制物体特征。残差连接和学习的聚合模块产生交互特征,在遮挡情况下改善手部和物体的估计。

RGB 图像*→对象 + 手部编码器→手部条件化解码器→*双手 + 物体位姿

→

输出

位姿、类别与检索

专用头回归双手 MANO 姿态和物体位姿(6D 旋转、平移和铰接)。为了避免需要物体几何结构作为输入,一个分类头预测物体类别并从模型池中检索其网格。

训练结合了单手和物体损失(2D/3D、位姿、形状、相机、类别)以及基于接触的交互损失,以鼓励物理一致的手-物体接触。

报告的基准测试快照

在实验室和野外环境均取得强劲提升

与最接近的基于学习的基线方法(ArcticNet-SF 和 JointTransformer,当前 ARCTIC 重建的最先进方法)相比,HOPformer 在实验室和野外环境都提升了接触一致性、手部准确性、运动和物体位姿。

82.4% ARCTIC [email protected],比先前最先进的方法高 +6.2 个百分点

20.7 mm EPIC-Contact 接触偏差,报告的最佳值

69.7% EPIC-Contact [email protected],从 56.9% 提升

EPIC-Contact · 自我中心,野外环境

方法 CDev ↓ MRRPEro↓ MDev ↓ ACCh/o↓ MPJPE ↓ [email protected] ↑ [email protected] ↑ ArcticNet-SF 94.21 66.77 0.13 3.9 / 5.3 44.81 6.55 5.9 JointTransformer 30.17 8.62 0.03 1.1 / 9.52 2.91 7.65 6.9 HOPformer 20.7−9.4 65.8−12.8 11.4−8.6 2.5 / 4.1 19.9−3.0 29.8+12.2 69.7+12.8 高亮行为 HOPformer。± 显示了超过最强先前方法(JointTransformer)的增益。HOPformer 在各项指标上均领先。

定性比较

并排查看重建结果

每种方法的 2D 投影(上)和旋转的 3D 重建(下),对比真值。

真值

ArcticNet-SF

JointTransformer

HOPformer 我们的

BibTeX

@inproceedings{bansal2026hopformer, title = {Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation}, author = {Bansal, Siddhant and Zhu, Zhifan and Tripathi, Shashank and Zhao, Jiahe and Black, Michael J. and Damen, Dima}, booktitle = {European Conference on Computer Vision (ECCV)}, year = {2026} }

相似文章

CM-EVS:稀疏全景RGB-D位姿数据用于完整场景覆盖

Hugging Face Daily Papers

本文提出了COVER,一种无需训练的方法,用于将3D资产转换为具有完整场景覆盖和低冗余度的稀疏全景RGB-D位姿数据,并介绍了包含36,373个来自室内和室外场景的精选帧的CM-EVS数据集。

人类通用抓取

Hugging Face Daily Papers

一种流匹配模型可从RGB-D图像生成多样化的人类抓取动作,实现零样本机器人抓取,性能优于现有方法。该模型在大规模自我中心数据集上训练,在新基准测试中显著超越当前最先进的基线方法。