@DataScienceHarp: 最著名的自我中心数据集是人们在自家厨房做饭的场景。我们正在训练的机器人正在朝向……

X AI KOLs Following 新闻

摘要

APAC-Egocentric-Stereo数据集提供第一人称视角的录制,展示了人们从事工业及其他工作的场景,包括立体视频、深度图、动作跟踪和字幕,现已在Hugging Face平台以FiftyOne格式发布。

最著名的自我中心数据集是人们在自家厨房做饭的场景。我们正在训练的机器人正被部署到仓库、车库和工厂车间。 APAC-Egocentric-Stereo数据集包含12个第一人称录制,展示了人们实际工作的场景:汽车修理厂、建筑工地、电子产品工厂、酒吧、货物分拣中心、洗衣店。 采用头戴式立体摄像机,每只眼睛分辨率1920x1080,帧率30 fps,还包括深度渲染、手部和头部跟踪,以及对佩戴者每个时刻动作的字幕。共有248个片段,涵盖62个不同的动词。 查看解析为FiftyOne格式的数据集。在FiftyOne中,所有流都在一个共享时间线上浏览:双眼、深度、跟踪和字幕合而为一,一行代码即可加载。 在此处查看数据集:https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo… 或者直接通过托管数据集的Hugging Face Space开始使用:https://huggingface.co/spaces/harpreetsahota/APAC-Egocentric-Stereo-Explorer…
查看原文
查看缓存全文

缓存时间: 2026/08/25 20:11

最著名的自中心数据集是人们在自己厨房做饭的场景。而我们用这些数据训练的机器人,目标场景是仓库、车库和工厂车间。

APAC自中心立体数据集包含12段第一人称视角的真实工作记录:汽车修理厂、建筑工地、电子产品工厂、酒吧、物流枢纽和洗衣店。

设备采用头戴式立体摄像机,每只眼睛的分辨率为1920×1080 @30fps,同时提供深度渲染、手部与头部追踪数据,以及佩戴者每个动作时刻的说明文字。数据集包含248个片段,涵盖62个不同的动作动词。

数据集已解析为FiftyOne格式。所有数据流都在FiftyOne的共享时间线上同步显示:左右眼画面、深度信息、追踪数据和字幕说明——只需一行代码即可加载完整数据。

数据集地址:https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo…

或直接使用托管该数据集的Hugging Face交互空间:https://huggingface.co/spaces/harpreetsahota/APAC-Egocentric-Stereo-Explorer…


Voxel51/APAC-Egocentric-Stereo · Hugging Face 数据集集

来源:https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo

https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#apac-egocentric-stereo-%E2%86%92-fiftyone-native-multimodal-mcapAPAC自中心立体数据集 → FiftyOne(原生多模态MCAP格式)

预览动图(https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo/blob/main/apac_egocentric.gif)

这是humyn-labs/APAC-Egocentric-Stereo-Labeled(https://huggingface.co/datasets/humyn-labs/APAC-Egocentric-Stereo-Labeled)的立体标注版本,已转换为原生多模态MCAP格式数据集。

记录了12位工作人员佩戴头戴式立体摄像机进行实际工作的真实场景。每个片段约一分钟,包含双眼校正视频、深度渲染图、手部与头部追踪渲染数据,以及每个时刻的佩戴者动作说明。工作场景涵盖工业、餐饮、物流和零售环境:汽车修理厂、建筑工地、电子产品工厂、餐厅、厨房、酒吧、物流枢纽、洗衣店、购物商场、服装店和书店。

https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#installation安装方法

pip install fiftyone

https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#usage使用方法

`` import fiftyone as fo import fiftyone.utils.huggingface as fouh

dataset = fouh.load_from_hub( “Voxel51/APAC-Egocentric-Stereo”, name=“APAC-Egocentric-Stereo”, persistent=True, ) fo.launch_app(dataset) ``

筛选工业工作场景:

view = dataset.match({"environment": "Industrial"})

https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#what-you-get数据集内容

共12个完整记录片段,总时长12.0分钟 @30fps。每个片段包含:

  • /stereo-camera:3840×1080的左右眼拼接视频(单眼1920×1080),以foxglove.CompressedVideo格式存储
  • /depth-map/hand-tracking:均为1920×1080分辨率,采用foxglove.CompressedVideo格式,与摄像机帧同步
  • /action/action-caption:包含每个片段的动作动词、操作对象和完整说明,在片段起始时间点标注
  • /action.plot:当前播放片段的索引序号
  • /instruction:该序列的任务描述文本

全部数据集共包含248个带字幕的片段和62个独立动词。

每个片段记录包含字段:sample_idenvironmentscenetask_descriptionverbsnum_segmentsnum_framesdurationfpssbs_widthsbs_heightper_eye_widthdepth_widthdepth_height

https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#notes-on-the-conversion转换说明

深度数据流是以H.264视频格式分发的伪彩色8位渲染图。其像素值代表颜色映射值,原始数据不包含逐像素距离信息。

手部与头部追踪数据是叠加在摄像画面上的可视化渲染,并非关节坐标序列流。

双眼画面存储在单个左右拼接视频流中。原始数据将校正后的立体视频对存储为单一文件,通过per_eye_width参数分割为左右两部分。

三个视频流均采用Annex-B H.264编码且无B帧。原始立体视频为MPEG-4 Part 2格式,原始深度和追踪视频为含B帧的H.264格式,因此所有视频都经过重新编码而非直接转封装。

片段按时间顺序无缝拼接,每段时长3秒(最后一个片段时长为剩余时间)。其中一个序列包含17个片段(而非标准的21段),因其总时长为50.8秒(而非约60秒)。

原始数据集的动词词汇存在大小写不一致问题(同时包含Applyingapplying)。verbs字段已进行大小写不敏感的去重处理。/action消息中的动词保留原始书写形式。

https://huggingface.co/datasets/Voxel51/APAC-Egocentric-Stereo#license–attribution版权声明与出处

源数据集由humyn labs(https://huggingface.co/humyn-labs)发布,采用CC BY 4.0(https://creativecommons.org/licenses/by/4.0/)许可证,本次转换版本沿用相同授权协议。

转换内容包括:格式转换为FiftyOne MCAP格式、动作片段编码为消息流、以及视频重新编码。

配套的单目版本数据集发布于:humyn-labs/APAC-Egocentric-Monocular-Labeled(https://huggingface.co/datasets/humyn-labs/APAC-Egocentric-Monocular-Labeled)

相似文章

ACE-Data-0:以人为中心的环境采集作为具身数据引擎

Hugging Face Daily Papers

介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。