@DataScienceHarp: 最著名的自我中心数据集是人们在自家厨房做饭的场景。我们正在训练的机器人正在朝向……
摘要
APAC-Egocentric-Stereo数据集提供第一人称视角的录制,展示了人们从事工业及其他工作的场景,包括立体视频、深度图、动作跟踪和字幕,现已在Hugging Face平台以FiftyOne格式发布。
查看缓存全文
缓存时间: 2026/08/25 20:11
最著名的自中心数据集是人们在自己厨房做饭的场景。而我们用这些数据训练的机器人,目标场景是仓库、车库和工厂车间。
APAC自中心立体数据集包含12段第一人称视角的真实工作记录:汽车修理厂、建筑工地、电子产品工厂、酒吧、物流枢纽和洗衣店。
设备采用头戴式立体摄像机,每只眼睛的分辨率为1920×1080 @30fps,同时提供深度渲染、手部与头部追踪数据,以及佩戴者每个动作时刻的说明文字。数据集包含248个片段,涵盖62个不同的动作动词。
数据集已解析为FiftyOne格式。所有数据流都在FiftyOne的共享时间线上同步显示:左右眼画面、深度信息、追踪数据和字幕说明——只需一行代码即可加载完整数据。
数据集地址:https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo…
或直接使用托管该数据集的Hugging Face交互空间:https://huggingface.co/spaces/harpreetsahota/APAC-Egocentric-Stereo-Explorer…
Voxel51/APAC-Egocentric-Stereo · Hugging Face 数据集集
来源:https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo
https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#apac-egocentric-stereo-%E2%86%92-fiftyone-native-multimodal-mcapAPAC自中心立体数据集 → FiftyOne(原生多模态MCAP格式)
预览动图(https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo/blob/main/apac_egocentric.gif)
这是humyn-labs/APAC-Egocentric-Stereo-Labeled(https://huggingface.co/datasets/humyn-labs/APAC-Egocentric-Stereo-Labeled)的立体标注版本,已转换为原生多模态MCAP格式数据集。
记录了12位工作人员佩戴头戴式立体摄像机进行实际工作的真实场景。每个片段约一分钟,包含双眼校正视频、深度渲染图、手部与头部追踪渲染数据,以及每个时刻的佩戴者动作说明。工作场景涵盖工业、餐饮、物流和零售环境:汽车修理厂、建筑工地、电子产品工厂、餐厅、厨房、酒吧、物流枢纽、洗衣店、购物商场、服装店和书店。
https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#installation安装方法
pip install fiftyone
https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#usage使用方法
`` import fiftyone as fo import fiftyone.utils.huggingface as fouh
dataset = fouh.load_from_hub( “Voxel51/APAC-Egocentric-Stereo”, name=“APAC-Egocentric-Stereo”, persistent=True, ) fo.launch_app(dataset) ``
筛选工业工作场景:
view = dataset.match({"environment": "Industrial"})
https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#what-you-get数据集内容
共12个完整记录片段,总时长12.0分钟 @30fps。每个片段包含:
/stereo-camera:3840×1080的左右眼拼接视频(单眼1920×1080),以foxglove.CompressedVideo格式存储/depth-map与/hand-tracking:均为1920×1080分辨率,采用foxglove.CompressedVideo格式,与摄像机帧同步/action与/action-caption:包含每个片段的动作动词、操作对象和完整说明,在片段起始时间点标注/action.plot:当前播放片段的索引序号/instruction:该序列的任务描述文本
全部数据集共包含248个带字幕的片段和62个独立动词。
每个片段记录包含字段:sample_id、environment、scene、task_description、verbs、num_segments、num_frames、duration、fps、sbs_width、sbs_height、per_eye_width、depth_width和depth_height。
https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#notes-on-the-conversion转换说明
深度数据流是以H.264视频格式分发的伪彩色8位渲染图。其像素值代表颜色映射值,原始数据不包含逐像素距离信息。
手部与头部追踪数据是叠加在摄像画面上的可视化渲染,并非关节坐标序列流。
双眼画面存储在单个左右拼接视频流中。原始数据将校正后的立体视频对存储为单一文件,通过per_eye_width参数分割为左右两部分。
三个视频流均采用Annex-B H.264编码且无B帧。原始立体视频为MPEG-4 Part 2格式,原始深度和追踪视频为含B帧的H.264格式,因此所有视频都经过重新编码而非直接转封装。
片段按时间顺序无缝拼接,每段时长3秒(最后一个片段时长为剩余时间)。其中一个序列包含17个片段(而非标准的21段),因其总时长为50.8秒(而非约60秒)。
原始数据集的动词词汇存在大小写不一致问题(同时包含Applying和applying)。verbs字段已进行大小写不敏感的去重处理。/action消息中的动词保留原始书写形式。
https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#license–attribution版权声明与出处
源数据集由humyn labs(https://huggingface.co/humyn-labs)发布,采用CC BY 4.0(https://creativecommons.org/licenses/by/4.0/)许可证,本次转换版本沿用相同授权协议。
转换内容包括:格式转换为FiftyOne MCAP格式、动作片段编码为消息流、以及视频重新编码。
配套的单目版本数据集发布于:humyn-labs/APAC-Egocentric-Monocular-Labeled(https://huggingface.co/datasets/humyn-labs/APAC-Egocentric-Monocular-Labeled)
相似文章
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
@LeRobotHF:100,000小时的人类双手进行真实工作。LeRobot格式,完全标注且开放。EgoSuite-Open100K来自@LightwheelAI
LightwheelAI和Hugging Face发布了EgoSuite-Open100K,这是一个包含100,000小时第一人称视角人类活动的大规模开放数据集,完全标注并以LeRobot格式提供,用于AI研究和训练。
ACE-Data-0:以人为中心的环境采集作为具身数据引擎
介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。
@macrodata_labs: 大家都在押注用第一人称视角数据来扩展机器人技术,但要将这些影像转化为训练数据,需要恢复……
Macrodata Labs 发布了一篇研究博客,介绍如何仅使用开源模型来恢复三维手部运动信号,从而利用第一人称视角视频数据扩展机器人技术。
EgoCS-400K:一个面向世界模型的第一人称游戏数据集
EgoCS-400K 是一个大规模的第一人称反恐精英数据集,包含超过40万段第一人称视频和10,000小时的游戏玩法,为世界模型研究提供了时间对齐的视频-动作-语言轨迹。