极简视觉惯性里程计

Hugging Face Daily Papers 论文

摘要

一种极简视觉惯性里程计方法,使用四个带有光学Gabor掩模的光电二极管和一个时序卷积网络,实现对差动驱动机器人的精确平面运动估计,并在多种室内外地形上进行了验证,无需实际场景微调。

视觉惯性里程计(VIO)对于移动机器人导航至关重要,它通常使用具有大量像素的摄像头。捕捉和处理摄像头图像需要大量资源。本文提出了一种极简的平面里程计方法,证明仅需四个视觉测量值和一个IMU即可为差动驱动机器人提供鲁棒的运动估计。我们的关键洞察是,四个朝下的光电二极管通过光学Gabor掩模感知世界,产生的信号编码了速度信息。基于此,我们使用物理仿真器联合优化掩模参数和时序卷积网络(TCN)。得到的模型能够仅从光电二极管产生的四个测量值解码出速度。将这些速度估计与IMU的角速度相结合,即可得到连续的平面轨迹。我们通过安装在差动驱动机器人上的原型传感器验证了该方法。在多种室内外地形上,我们的系统紧密跟踪参考真值,无需任何实际场景微调。我们的工作表明,极简感测能够实现高效且精确的平面里程计。
查看原文
查看缓存全文

缓存时间: 2026/05/22 10:19

论文页面 - 极简视觉惯性里程计

来源:https://huggingface.co/papers/2605.19990

摘要

一种极简视觉惯性里程计方法,利用四个带光学Gabor掩膜的光电二极管和时序卷积网络,实现了差分驱动机器人的精确平面运动估计。

视觉惯性里程计(Visual-Inertial Odometry,VIO)对于移动机器人导航至关重要,它使用具有大量像素的相机。捕获和处理相机图像需要大量资源。本文提出了一种极简的平面里程计方法,证明仅需四个视觉测量值和一个IMU就能为差分驱动机器人(differential-drive robots)提供鲁棒的运动估计。我们的关键洞察是:四个向下面对的光电二极管(photodiodes)通过光学Gabor掩膜(optical Gabor masks)感知世界,产生的信号能够编码速度。基于此,我们联合优化掩膜参数与时序卷积网络(Temporal Convolutional Network,TCN),并使用基于物理的仿真器(physically-grounded simulator)进行训练。最终模型仅从光电二极管产生的四个测量值中解码速度。将这些速度估计与IMU的角速度结合,即可得到连续的平面轨迹。我们通过安装于差分驱动机器人上的原型传感器验证了该方法。在多种室内外地形中,我们的系统无需任何真实世界微调即可紧密跟踪参考真值。我们的工作表明,极简感知能够实现高效且精确的平面里程计。

查看arXiv页面(https://arxiv.org/abs/2605.19990)查看PDF(https://arxiv.org/pdf/2605.19990)项目页面(https://cave.cs.columbia.edu/projects/categories/project?cid=Computational%20Imaging&pid=Minimalist%20Visual%20Inertial%20Odometry)GitHub4(https://github.com/pastifra/four-pixel-vio)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.19990)

在你的代理中获取这篇论文:

hf papers read 2605.19990

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

尚无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.19990 以从此页面链接。

引用此论文的数据集0

尚无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.19990 以从此页面链接。

引用此论文的Spaces0

尚无Space链接此论文

请在Space README.md 中引用 arxiv.org/abs/2605.19990 以从此页面链接。

包含此论文的收藏集0

尚无收藏集包含此论文

请将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

PointDiT: 像素空间扩散用于单目几何估计

Hugging Face Daily Papers

PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。

物理自监督学习:无人工标签的IMU传感

arXiv cs.LG

提出物理自监督学习,一种用于无标签IMU传感的自编码器范式,该范式用基于物理的解码器替换神经解码器,在无人工标签的情况下,在跟踪和动作捕捉任务中实现高达5倍的误差减少。

用于单IMU活动识别的动态影响加权蒸馏

arXiv cs.LG

本文介绍了动态影响加权(DIW),一种知识蒸馏方法,通过在训练过程中动态加权来自多个IMU的教师目标,来改进单IMU活动识别,实现了显著的性能提升。

Inertia-1:对统一运动基础模型的开放探索

Hacker News Top

Inertia-1是一个研究项目,系统性地探索运动模型的完整生命周期——数据、感知、目标和规模——以产生一种统一的表示,该表示无需重新训练即可跨身体位置、设备和任务迁移,利用了在1800万小时加速度计数据上的自监督预训练。

LIMMT:动作追踪中的少即是多

Hugging Face Daily Papers

本文介绍了LIMMT,这是一项以数据为中心的研究,表明使用高质量、极小的运动数据子集(不到AMASS的3%)进行训练,在基于物理的人形动作追踪方面优于使用完整数据集,并通过物理可行性、多样性和复杂性来定义运动数据质量。