EgoForce: 前臂引导的相机空间3D手部姿态——来自单目第一人称相机
摘要
EgoForce是一个单目3D手部重建框架,使用统一网络,包含可微分前臂表示、手臂-手部变换器和射线空间求解器,能够在不同相机模型下恢复绝对手部姿态和位置,在多个第一人称基准测试中达到了最先进的精度。
查看缓存全文
缓存时间: 2026/05/13 20:14
论文页面 - EgoForce:基于前臂引导的单目自拍视角相机空间3D手部姿态
来源:https://huggingface.co/papers/2605.12498
摘要
EgoForce 是一个单目 3D 手部重建框架,它通过一个统一的网络,利用可微分的前臂表示、手臂-手部变换器和射线空间求解器,在不同相机模型下恢复鲁棒的、绝对的手部姿态和位置。
使用单个头戴式相机从用户视角重建手部的绝对 3D 姿态和形状,对于 AR/VR、远程呈现以及以手部为中心的操控任务等实际自拍交互至关重要,这些场景要求传感设备保持紧凑且不引人注目。尽管单目 RGB 方法已取得进展,但它们仍受限于深度-尺度歧义(https://huggingface.co/papers?q=depth-scale%20ambiguity),并且难以泛化到头戴式设备的多种光学配置。因此,模型通常需要在特定设备的数据集上进行大量训练,而这些数据集的获取成本高昂且劳动密集。本文通过引入 EgoForce 来解决这些挑战,这是一种单目 3D 手部重建(https://huggingface.co/papers?q=monocular%203D%20hand%20reconstruction)框架,能够从用户(相机空间)视角恢复鲁棒的、绝对的 3D 手部姿态及其位置。EgoForce 使用单个统一网络,可在鱼眼、透视和畸变宽视场相机模型(https://huggingface.co/papers?q=distorted%20wide-FOV%20camera%20model)上运行。我们的方法结合了可微分的前臂表示(https://huggingface.co/papers?q=differentiable%20forearm%20representation)来稳定手部姿态,一个统一的手臂-手部变换器(https://huggingface.co/papers?q=arm-hand%20transformer)从单张自拍视图中同时预测手部和前臂几何形状,从而缓解深度-尺度歧义(https://huggingface.co/papers?q=depth-scale%20ambiguity),以及一个射线空间闭式求解器(https://huggingface.co/papers?q=ray%20space%20closed-form%20solver),能够在各种头戴式相机模型下实现绝对 3D 姿态恢复。在三个自拍基准上的实验表明,EgoForce 达到了最先进的 3D 精度,与先前方法相比,在 HOT3D 数据集上相机空间 MPJPE 降低了高达 28%,并在不同相机配置下保持一致的性能。更多详情,请访问项目页面:https://dfki-av.github.io/EgoForce/。
查看 arXiv 页面(https://arxiv.org/abs/2605.12498)查看 PDF(https://arxiv.org/pdf/2605.12498)项目页面(https://dfki-av.github.io/EgoForce/)GitHub(https://github.com/dfki-av/EgoForce)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.12498)
在您的代理中获取此论文:
hf papers read 2605.12498
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.12498,即可从此页面链接。
引用此论文的数据集1
chris10/EgoForce 更新于 23 分钟前 • 11.4k (https://huggingface.co/datasets/chris10/EgoForce)
引用此论文的 Spaces1
包含此论文的收藏0
没有包含此论文的收藏
将本论文添加到收藏(https://huggingface.co/new-collection)中,即可从此页面链接。
相似文章
EgoPhys:从第一人称视频学习可变形物体的通用物理模型
EgoPhys 提出一个框架,利用通用先验和紧凑码本从第一人称 RGB 视频构建可变形物理数字孪生,无需针对每个弹簧进行优化即可实现对新物体的零样本泛化。该系统在真实机器人上进行了演示,表明第一人称人类玩耍视频可以作为可变形物体规划的内部世界表征。
Ego-OSCAR:第一人称开源立体捕捉系统
Ego-OSCAR 提出了一款开源、低成本的头戴式立体惯性捕捉设备,用于第一人称数据采集,并发布了硬件设计、软件以及约550小时带IMU数据的已标注立体视频。
EgoSteer: 从第一人称视频实现可引导灵巧操作的全栈系统
EgoSteer提出一个全栈系统,从第一人称人类视频预训练视觉-语言-动作模型,实现可引导的灵巧操作,在40多个多样化任务上展现鲁棒泛化能力,复杂长时任务成功率超过75%。
ReViV:从单目第一人称视频中重建观看者与场景的四维动态
ReViV是一个统一的整体性第一人称4D重建框架,它通过掩码生成式第一人称Transformer,从单目RGB视频中同时重建观看者(身体、手、视线)和场景(深度、相机轨迹)的动态,实现了最先进的准确性和效率。
@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。