@seclink: New repo: Awesome Egocentric Dataset — a curated list of first-person vision datasets, refreshed beyond the classic Ego…
Summary
A new open-source repository curates a list of egocentric (first-person vision) datasets, updated to include recent releases from 2023–2026 with sections on VLA papers and broken links removed.
View Cached Full Text
Cached at: 08/19/26, 06:45 PM
New repo: Awesome Egocentric Dataset — a curated list of first-person vision datasets, refreshed beyond the classic Ego4D-era list.
Recent 2023–2026 releases (Ego-Exo4D, EgoSchema, AEA, EgoExoLearn, EgoLife…) Dead/broken links removed, migrated ones fixed A section on egocentric-driven VLA papers (training source + data-processing), with first-principles + fishbone analysis
Open-source, contributions welcome. https://github.com/XiaomingX/awesome-egocentric-dataset…
#EgocentricVision #FirstPersonVision #VLA #ComputerVision #Datasets
XiaomingX/awesome-egocentric-dataset
Source: https://github.com/XiaomingX/awesome-egocentric-dataset
Awesome Egocentric Dataset(第一人称视觉数据集精选)
精选的 egocentric(第一人称)视觉数据集清单 —— 从经典基准到 2023–2026 最新发布。
覆盖日常活动理解、手-物交互、导航、视频-语言、长期记忆等研究方向。
目录
关于
本仓库维护一份持续更新的第一人称视觉数据集清单。它借鉴了广受引用的 Egocentric-Dataset 清单(该清单停更于 2022 年),并做了如下刷新:
- 剔除官方页面已失效或不再维护的数据集。
- 更新已迁移到新官方页面的数据集链接。
- 新增最近三年(2023–2026)发布的重要数据集。
每个条目都附简要描述(机构、任务类型、规模,若已知)。
近年新数据集(2023–2026)
Ego4D / Ego-Exo4D 与基准
- Ego-Exo4D — Meta AI / UIUC(2023,NeurIPS)。大规模多模态多视角数据集,包含同步的第一人称 + 多路第三人称视频,覆盖熟练人类活动(约 116 小时),含 3D 手/身体/注视标注与基准。[论文] [代码]
- EgoSchema — 加州大学伯克利分校 BAIR(CVPR 2024)。超长视频理解诊断基准;约 5,000 段 180 秒 Ego4D 片段 + 人工标注选择题。[论文]
- EgoTracks — Meta AI(2023)。基于 Ego4D 的长期目标跟踪基准,5.9k 视频中约 22.42k 条轨迹。
- EgoPet — Technion(ECCV 2024)。动物第一人称视频数据集(自我运动 + 交互),含三个行为基准任务。[论文]
- EgoHumans — 卡内基梅隆大学(ICCV 2023)。首个野外多人体 3D 理解第一人称基准;12.5 万+ 图像,含 SMPL / SMPL-X 标注。[论文]
智能眼镜与 Project Aria
- Aria Everyday Activities (AEA) — Meta Reality Labs(CVPR 2024)。来自 Aria 智能眼镜的开放多模态日常活动数据集;143 段(约 18 小时),含 IMU / 眼动。[论文]
- Aria Digital Twin (ADT) — Meta Reality Labs(2023)。用 Aria 采集的第一人称 3D 基准,配大规模仿真真值(设备/物体/场景 3D)。[论文]
- Nymeria — Meta Reality Labs(ECCV 2024)。最大规模野外全身运动数据集;264 名参与者、300 小时,用 Aria 眼镜采集。
- HOT3D — Meta(2024)。第一人称 3D 手-物交互跟踪;833 段序列,由 Aria + Quest 3 采集,是官方 BOP 数据集之一。[论文] [代码]
- HD-EPIC — 多机构联合(CVPR 2025)。高细节第一人称视频数据集;41 小时非脚本厨房视频,逐帧 3D / 手 / 语音密集标注。[论文]
- LookOut / AND —(ICCV 2025)。真实人形第一人称导航数据集;约 4 小时 Aria 导航录制,面向基于 VLM 的导航。
第一人称视频理解与视频大模型
- EgoExoLearn — 上海人工智能实验室 / OpenGVLab(CVPR 2024)。大规模异步 ego-exo 程序性活动数据集,1000+ 小时分层程序标注。[论文] [代码]
- EgoThink —(CVPR 2024 Highlight)。评估 VLM 第一人称“思考“的基准,六类任务,选自 Ego4D。[论文] [代码]
- VidEgoThink —(2024)。第一人称视频理解评测;约 400 个视频问答样本。[论文]
- EgoVideo — 上海人工智能实验室 / OpenGVLab(2024)。在大型预训练数据上训练的第一人称视频基础模型。[代码]
- EgoTempo — Google Research 等(CVPR 2025)。评测多模态大模型在第一人称视频中的时序理解。[代码]
- EgoLife — 南洋理工大学(CVPR 2025)。超长(周级)AI 生活助手数据集;6 名参与者、300 小时,含 EgoLifeQA 基准。[论文] [代码]
- EgoThinker / EgoRe-5M —(NeurIPS 2025)。第一人称推理数据集,500 万因果 CoT 问答样本 + 手物标注。
- EgoCVR —(ECCV 2024)。第一人称细粒度组合式视频检索基准。
- OpenMMEgo (OME10M) —(NeurIPS 2025)。千万级第一人称时空视频知识数据集,用于增强多模态大模型。
- EVUD — alanaai(2026)。面向视频大模型的 第一人称视频指令微调数据集。
手-物交互与灵巧操作
- EgoDex — Apple(2025)。最大规模第一人称灵巧操作数据集;829+ 小时,用 Vision Pro 采集并含 3D 手部姿态。[论文]
- OpenEgo —(2025)。大规模多模态第一人称灵巧操作数据集。
- EgoSim / MultiEgoView —(NeurIPS 2024)。第一人称多视角模拟器 + 真实数据集。
- EMHI —(2024)。多模态第一人称人体运动数据集。
长期记忆与第一人称视频问答
- SuperMemory-VQA —(2026)。第一人称 VQA 数据集,52.9 小时 AI 眼镜日常录制,用于长期记忆推理。
- EgoMemReason —(2026)。记忆驱动的长期第一人称视频推理基准(周级)。
经典数据集
以下为经典的第一人称数据集(2023 年之前),链接已更新到其当前官方页面。
- Ego4D — 3025 小时日常活动视频,来自 9 个国家的 74 个地点、855 位佩戴者。[下载]
- EgoCom — 自然对话数据集,多模态人机沟通数据,从参与者第一人称视角同步采集。
- EPIC-Kitchens — 参与者在原生环境中进行非脚本动作(含 EPIC-Kitchens 55、EPIC-KITCHENS-100 及 2018/2020 版本)。
- EPIC-Tent — 29 名参与者佩戴两个头戴相机搭建帐篷。[论文]
- MECCANO — 20 名受试者组装玩具摩托车。[代码]
- EGO-CH — 70 名受试者参观意大利西西里两处文化遗址。
- EGTEA Gaze+ — 32 名受试者、86 次烹饪、28 小时带注视信息的第一人称烹饪视频。[镜像]
- ADL — 20 名受试者在原生环境中进行日常活动。
- CMU Kitchen — 多模态,18 名受试者烹饪 5 种食谱(布朗尼、鸡蛋、披萨、沙拉、三明治)。
- EgoSeg — 长期动作分割(行走、跑步、驾驶等)。
- First-Person Social Interactions — 8 名受试者在迪士尼乐园的第一人称社交交互。
- UEC Dataset — 两个编排的第一人称动作数据集(走、跳、攀爬等)+ 6 段 YouTube 运动视频。
- JPL — 与机器人的第一人称交互。
- FPPA — 5 名受试者执行 5 种日常动作,用于动作预测。
- UT Egocentric — 3–5 小时长视频,记录一个人的一天。
- VINST / Visual Diaries — 31 段视频,记录受试者从地铁站步行到工作地点的视觉体验。
- BEOID (Bristol Egocentric Object Interaction) — 8 名受试者、六个地点;与物体和环境的交互。
- Object Search Dataset — 55 名受试者的 57 段序列,用于搜索与检索任务。
- UNICT-VEDI — 受试者参观博物馆。
- EgoGesture — 50 名受试者执行 83 种手势的 2k 段视频。
- DoMSEV — 不同活动共 80 小时的第一人称视频。
- DR(eye)VE — 74 段带注视信息的人驾驶视频。
- EgoDexter — 4 段序列、4 名演员,在杂乱背景中进行多样手-物交互。[论文]
- First-Person Hand Action (FPHA) — 3D 手-物交互;6 名演员、45 个活动类别、1175 段视频。[论文]
- UTokyo PEV / Ego-Surf — 面对面交谈中同步录制的成对第一人称片段(PEV)与群组第一人称视频(Ego-Surf)。
- TEgO — 可教学第一人称物体;19 个不同物体的图像,用于训练可教学物体识别器。
- Multimodal Focused Interaction — 19 段会话、17 位对话伙伴、377 分钟的连续多模态录制。
- TREK-100 — 第一人称视觉中的目标跟踪(100 段视频)。
- Charade-Ego — 成对的第一人称与第三人称日常活动视频。
已剔除样本
以下来自原 Egocentric-Dataset 清单的数据集被剔除,因为其官方页面已无法访问、且无可靠官方镜像:
- EgoHands — 印第安纳大学官方页面已失效;仅剩非官方第三方镜像。
- THU-READ — 清华大学原页面无法访问;无可靠官方备份。
参与贡献
欢迎贡献。要新增或修正数据集条目,请发起 Pull Request 或 Issue。请确保:
- 数据集与 egocentric / 第一人称视觉相关。
- 官方链接可访问。
- 附带一行描述(机构、任务、规模)。
许可
本清单以 CC0-1.0 提供。各数据集的许可证以各自链接为准。
Egocentric 视角下的 VLA 论文(2023.08 – 2026.08)
抓大放小,只保留与 egocentric(第一人称)数据 直接相关的论文。收录标准: ① 以 egocentric 数据作为训练来源(egocentric 人类视频 / 可穿戴视角作为 VLA 预训练或微调输入); ② 针对 egocentric 数据做加工改进(质检、清洗、标注、伪标签、训练方法)。 与 egocentric 无关的通用 VLA 里程碑(RT-2、OpenVLA、π0 系列、Octo、DexVLA、WorldVLA 等)不在本清单。
一句话结论(金字塔之顶)
egocentric 人类视频之于 VLA,是一条“取之不尽、尚未充分开采“的训练水源;这三年的范式主线是「如何把第一人称视频变成可用的动作信号」——先直接用人手/手腕动作作标签,再发展为“伪标签 + 互联网预训练“,再到“一套流水线同时解决质检、标注与训练“,最终证明经过良好加工的第一人称数据可以匹敌甚至超过真实机器人数据。
第一性原理:egocentric 数据在 VLA 里卡在哪?(金字塔之基)
要拿第一人称视频训练 VLA,本质要打通三件事:
- 动作从哪来 —— 第一人称视频没有动作标签,只有人眼看到的人手/手腕运动,如何得到 P(a_t)?
- 数据如何干净 —— 原始第一人称视频含噪声、不完整轨迹、视角/本体差异,如何质检、清洗、标注?
- 学完怎么用 —— 人类视频学到的“人怎么做“,如何迁移到机器人/不同本体?
三年所有与 egocentric 相关的 VLA 工作,都落在打通这三件事上:
| 维度 | 直接做人手标签 | 伪标签 / 互联网预训练 | 流水线加工 + 训练 |
|---|---|---|---|
| 动作来源 | 人手/手腕动作直接预测(EgoVLA、Ego-Pi) | latent action 伪标注,egocentric 视频入预训练(Gr00T N1、LAPA) | 自动轨迹提取 + 可靠性加权(EgoScaler、ACE-Ego-0) |
| 数据加工 | 依赖手部标注 | 少量依赖、伪标签化 | 质检/清洗/标注一体化流水线(EgoScaler、HumanScale) |
| 下游迁移 | 逆运动学重定向到机器人 | 统一进基础模型 | 与机器人数据联合训练 |
核心逻辑:egocentric 数据的价值上限,取决于“加工成本“与“动作信号质量“的比值。每一篇论文都是在降低加工成本、或提升动作信号质量——这条判据可解释整个时间线。
里程碑时间线(金字塔之身,按第一性原理分层)
第一层:egocentric 视频直接入 VLA(2025)
- Gr00T N1(2025-03,arXiv:2503.14734,NVIDIA)—— ①类(训练来源,最强相关):数据金字塔底部明确纳入 7 个 egocentric 人类视频数据集(Ego4D、Ego-Exo4D、EPIC-KITCHENS、Assembly-101、HOI4D、HoloAssist、RH20T-Human),用 VQ-VAE latent action / IDM 伪标注统一训练,首次把“第一人称人类视频“大规模搬进人形 VLA 基础模型。
- EgoVLA(2025-07,arXiv:2507.12440)—— ①类(训练来源):直接用 egocentric 人类视频训练 VLA,预测人手/手腕动作,再经逆运动学/重定向转成机器人动作;自建 Ego Humanoid Manipulation Benchmark 双机械臂任务评测,证明第一人称视频可训出可迁移的 VLA。
第二层:把加工做成流水线(2025)
- EgoScaler(2025-09,arXiv:2509.21986)—— ②类(数据标注/清洗):从原始 egocentric 视频自动提取 6DoF 物体操作轨迹(无需额外手部标注),自动修正噪声/不完整轨迹,构建大规模 VLA 预训练数据集;基于 π0 架构验证预训练提升 20%+。解决“动作从哪来 + 数据如何干净“。
第三层:egocentric 与机器人数据联合、并证明其价值(2026)
- Ego-Pi(2026-06,arXiv:2606.08107)—— ①类(训练来源):以 π0.5 为基座,在带五指的类人机器人上联合学习 egocentric 人类数据与机器人数据,证明第一人称数据能让机器人学到“无对应机器人数据“的任务语义并组合技能。
- ACE-Ego-0(2026-06,arXiv:2606.17200)—— ②类(标注流水线 + 训练):构建可扩展的 egocentric 视频→动作标注流水线,将原始人类视频转成机器人格式伪动作轨迹,并用可靠性加权训练抑制伪标签噪声;联合 1.48K 小时 egocentric 人类数据 + 机器人数据预训练。
- HumanScale(2026-06,arXiv:2606.20521)—— ① + ② 类:系统对比 egocentric 人类视频 vs 遥操作机器人轨迹作为具身预训练来源,发现经精心设计的过滤 + 标注流水线后,egocentric 数据可超越真实机器人数据(验证损失 −24%,成功率显著提升)。这是“egocentric 数据加工价值“最强论据。
附:混合预训练来源中的 egocentric 成分
- LAPA(2024-10,arXiv:2410.11758,ICLR 2025)—— ①类(部分):以“无动作标签的互联网视频学 latent action“为核心;其混合预训练数据含 Something-Something V2(论文标注为第一人称人类操作视频),egocentric 是其预训练来源之一(非主线,但属 egocentric 数据入 VLA 的早期代表)。
去噪音说明:π0/π0.5/π0.6/π0.7、OpenVLA、RDT-1B、DexVLA、Octo、RT-X 等虽属 VLA 主线,但其预训练/微调数据不含 egocentric 人类数据(多为机器人轨迹/通用互联网图文),与 egocentric 无关,故不收录。Nova、PaSa 无法核实,亦不收录。
鱼骨图(Fishbone:egocentric 数据如何驱动 VLA 训练)
┌──────────── 结果:用第一人称人类视频驱动 VLA 训练 ─────────────┐
│ │
动作来源 │ 数据加工(质检/标注) │ 下游迁移 / 训练
(动作从哪来) │ (数据如何干净) │ (学完怎么用)
│ │
┌───────┴────────┐ ┌─────────┴─────────┐
│ 直接预测人手/ │ │ 迁移到机器人 │
│ 手腕动作 │ │ (IK 重定向) │
│ (EgoVLA 25) │ │ (EgoVLA 25) │
└───────┬────────┘ └─────────┬─────────┘
│ │
┌───────┴────────┐ ┌─────────┴─────────┐
│ 伪标签 latent │ │ 联合机器人数据 │
│ action (VQ-VAE)│ │ co-training │
│ (Gr00T N1 25) │ │ (Ego-Pi 26) │
└───────┬────────┘ └─────────┬─────────┘
│ │
└───────────┬────────────────────────────┘
│
┌───────────────┴───────────────┐
│ 自动轨迹提取 / 伪标签 │
│ (EgoScaler 25) │
└───────────────┬───────────────┘
│
┌───────────────┴───────────────┐
│ 标注流水线 + 可靠性加权 │
│ 过滤/质检 (ACE-Ego-0, │
│ HumanScale 26) │
└───────────────┬───────────────┘
│
┌───────────────┴───────────────┐
│ egocentric > 机器人数据 │
│ (HumanScale 26 结论) │
└───────────────────────────────┘
读图方式:主骨是“用第一人称数据驱动 VLA 训练“;三根大刺分别为“动作来源 / 数据加工 / 下游迁移“。鱼骨中部自左向右,代表“加工流水线“越做越完整(自动提取 → 标注流水线 → 过滤质检 → 超越机器人数据),即该维度不断“去人工、去噪声“的演进方向。
Similar Articles
EgoCS-400K: An Egocentric Gameplay Dataset for World Models
EgoCS-400K is a large-scale egocentric Counter-Strike dataset with over 400,000 first-person videos and 10,000 hours of gameplay, providing temporally aligned video-action-language trajectories for world model research.
@RekaAILabs: CS2-10k is now available on @huggingface 600,000+ egocentric gameplay videos. 10,000+ hours. Every frame paired with th…
Reka AI Labs releases CS2-10k, a large dataset of over 600,000 egocentric gameplay videos with 10,000+ hours of frame-level keyboard, mouse, and 3D position data, available on Hugging Face for world models, action-conditioned video generation, and egocentric navigation research.
Ego-OSCAR: Egocentric Open source Stereo CAptuRe System
Ego-OSCAR presents an open-source, low-cost head-mounted stereo-inertial capture device for egocentric data collection, releasing hardware designs, software, and about 550 hours of annotated stereo video with IMU data.
@macrodata_labs: Everyone is betting on Egocentric data to scale robotics But turning that footage into training data requires recoverin…
Macrodata Labs releases a research blog on scaling robotics with egocentric video data by recovering 3D hand motion signals using only open-source models.
Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
Open-AoE is an open, community-oriented egocentric manipulation dataset and toolchain that spans from smartphone capture to model training, providing approximately 2,000 hours of manipulation video with annotations and downstream tools for embodied learning.