人类活动数据
人类活动数据
人类活动数据是人在真实物理世界中产生的视角、动作、身体轨迹、工具使用、接触、任务上下文和纠错记录。它对机器人学习的价值主要是提供规模、环境多样性和人类技能先验;它不是天然的机器人控制数据,必须经过动作代理重建、本体对齐、机器人数据落地和部署纠错才能进入可执行策略。
六级控制权与动作真值谱系
| 层 | 典型对象 | 控制权与原生动作 | 能直接提供什么 | 仍不能直接提供什么 |
|---|---|---|---|---|
| 自然第一视角观察 | Ego4D | 人控制自己的身体;无机器人原生动作 | 视觉、语义、时序、任务分布与手—物关系 | 机器人 proprioception、force、reward 和安全结果 |
| 结构化 ego/exo 技能记录 | Ego-Exo4D | 人控制自己的身体;无机器人原生动作 | 同步多视角、3D 手/身体、技能步骤与几何对应 | 目标机器人的关节可达性、接触与动力学 |
| human+robot 共同训练 | EgoMimic | 人和机器人分别示范;原生动作只在机器人侧 | 共享 pose 语义、环境多样性与少量 robot data grounding | 任意新本体的零样本可执行性 |
| 接口约束人类示范 | Universal Manipulation Interface | 人操作类机器人末端;得到 robot-compatible 动作代理 | 末端轨迹、夹爪状态、相对动作与时间对齐 | 目标机器人原生关节、碰撞、动力学与触觉真值 |
| 真机遥操作 | DROID 数据集 等 | 人全程控制目标机器人;有机器人原生状态和动作 | 部署前示范、失败 episode 与同本体多场景覆盖 | 当前策略自己会访问的失败状态和介入上下文 |
| 策略部署局部接管 | HIL-SERL、LeRobot HIL 等 | 策略自主与人局部接管;有实际执行动作 | on-policy 失败邻域、恢复、纠正与控制权切换 | schema 缺失时的策略反事实动作、介入原因和自主 outcome |
自然与结构化不是证据等级高低,而是采集目的不同。Ego4D 更接近日常 in-the-wild 观察;Ego-Exo4D 是自然场景中的预定义熟练活动;EgoMimic 和 Universal Manipulation Interface 则是明确任务目标下的策划式示范。
从视频到策略的转换链
- 观察先验:人类视频先学习视觉表征、任务阶段、对象关系或价值函数。R3M 与 V-PTR 说明这一路线可以改善机器人下游数据效率,但两者都还需要机器人 transition 或目标任务示范。
- 动作代理:3D 手轨迹、工具中心坐标、机器人化夹爪或视觉流把“人做了什么”压成可映射的 pose/trajectory。带 3D、IMU 或 gaze 不等于已经有机器人 action。
- 视觉与运动学对齐:相机尺度、视角、手/夹爪外观、动作归一化、relative trajectory 和本体专属网络分别处理不同的 embodiment gap。
- 机器人落地:目标机器人的关节范围、碰撞、控制频率、传感器延迟和接触动力学必须由真机数据或明确约束补足。
- 部署闭环:只有在当前策略 rollout 中记录自主段、接管、恢复、纠正和 outcome,数据才覆盖模型自己的失败分布。
已核验的结果与反例
- Ego4D 的机器人证据主要是表征和价值预训练:V-PTR 在 WidowX 六任务汇总中报告 44/72,对 BC 为 8/72,但仍对工作台高度、相机角度和机器人配置敏感。
- Ego-Exo4D 的 TriHands 路线先从 532 个 cooking videos 重建 28 小时 3D 手轨迹,再加入每任务 150 条机器人示范并做本体专属映射;作者报告六任务平均提高 29.7 个百分点。这是“重建 + 共同训练”的证据,不是原始视频直接控制。
- EgoMimic 在同一 ViperX 本体上用人类和机器人数据共同训练;Object-in-Bowl 的 full method 为 128 points,无 human data 为 68。独立 Phantom 结果显示 red line 视觉编辑单独使用在四任务均为 0,说明全栈对齐不能缩成一个视觉技巧。
- Universal Manipulation Interface 用机器人化手持夹爪、relative trajectory 与 latency matching减少采集端差距;杯子策略从 UR5 转到 Franka FR2 为 18/20,两个失败均是 joint-limit violation,说明坐标不变不等于本体无关。
- DROID 是同一本体、多场景、全程遥操作数据。外部检索研究发现整库直接共同训练在六任务均为 0,按对象/技能、相机或空间对齐后才出现 35%–85% 的最佳结果;规模不能替代目标域匹配。
- LeRobot v0.6.0、v0.6.1 与截至 2026-08-10 的 main 都默认只保存人工纠错窗口;只有显式
record_autonomous=true才同时保存自主帧,而且生成的是按文件大小估算的时间切片,不是任务 episode。 intervention只表示控制来源,不等于失败或成功;当前 schema 也没有独立的 policy/executed action、介入原因、recovery/correction 子阶段和 outcome。
UMI 后续的规模、3D 与触觉边界(2026-08-10)
UMI 的后续不是把同一条链依次“补全”,而是在采集吞吐、轨迹标签、末端同构和接触监督上做不同交换:
| 系统 | 人的控制与动作代理 | 新增信息 | 策略实际消费 | 当前证据边界 |
|---|---|---|---|---|
| FastUMI | 人手持平行夹爪,T265 生成 EEF pose | 统一 ROS 时间、标准化安装;后续扩到单/双臂 | RGB、relative TCP;深度版还消费估计深度 | 原版从论文10k/22扩到15k/24;100K论文总体与公开34,052条双臂子集不能混写 |
| UMI-3D | 人手持平行夹爪,LiDAR-inertial SLAM 生成公制轨迹 | LiDAR、IMU、硬件触发相机与3D地图 | 当前公开策略只有 RGB+proprio | 3D改善的是采集/标签,不是已发布点云策略;最终长任务放置仅5%暴露运动学约束 |
| DexUMI | 人佩戴目标机器人手专用外骨骼,编码器映射手关节 | ARKit腕位姿、RGB与手型特定触觉 | 处理后的 robot-hand RGB+可选触觉 | 需要真实目标手 replay;触觉只在干净 salt force cue 上有明显增益,其他比较常无益或变差 |
| TacUMI(多模态事件分割) | 人双手操作线缆,左右设备非对称 | 触觉、F/T、RGB-D与双手 pose | 没有操控策略;信号进入离线事件分割器 | 单任务约30k frames;机器人侧 cross-platform 只是分割测试,不是控制迁移 |
因此,“人类活动数据更丰富”至少要拆成四个问题:是否更快覆盖任务;是否更准确恢复动作标签;是否与目标末端执行器同构;新增模态是否进入训练和部署观测。采集端有 LiDAR、触觉或力觉,不能自动提升为策略模态;relative SE(3) 也不能消除工作空间、关节极限、外骨骼几何、接触动力学和时延。
证据:原始资料快照(本地归档)
数据质量与评测
- 小时、takes、episodes、trajectories、demonstrations、tasks、scenes 与 total view-hours 保留原始单位,不折成单一“规模榜”。
- 分开报告作者实验、独立复现、外部使用与组件反例。EgoMimic/UMI 目前没有同协议端到端严格独立复现。
- HIL 评测至少分开 autonomous success、assisted completion、介入次数/时长、首次介入前自主时长,以及 fine-tuning 前后 ID/OOD 成功率。
- 机器人示范通常单条控制精度更高;人类示范的优势在吞吐量和环境多样性。二者的每小时数量不能直接解释为等量信息。
许可与人的权利
- Ego4D/Ego-Exo4D 是 gated agreement,不是无条件开源;实际签署协议优先于公开 draft。
- UMI 与 EgoMimic 代码为 MIT,但公开数据未找到独立明确许可;代码许可不能替代视频和数据权利。
- DROID 原始数据为 CC BY 4.0,LeRobot 核心代码为 Apache-2.0;派生数据仍需追踪上游许可。
- 第一视角和家庭活动视频可能捕捉旁人、住址、屏幕、身份与技能信息。知情同意、退出/撤回、去标识、二次使用、跨境处理和撤回传播是训练可用性的一部分。
相关页面
- 具身智能数据基础设施
- 具身智能系统工程
- 以人为中心的具身智能
- 以人为中心的具身模型范式
- 人形机器人基础模型
- Ego4D
- Ego-Exo4D
- EgoMimic
- Universal Manipulation Interface
- FastUMI
- UMI-3D
- DexUMI
- TacUMI(多模态事件分割)
- 手亿科技
- 灵初智能
- Ego-NeuroLoop
证据
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)
2026-08-10 与机器人原生开放数据的边界
Open X-Embodiment、DROID 数据集、LeRobotDataset 与 AgiBot World 主要属于机器人原生示范、遥操作、格式或平台基础设施,不属于纯人类活动视频语料。AgiBot 的 VR/全身 mocap 是控制机器人采集轨迹的接口,不能因为操作者是人就把整库归入自然人类活动数据。
这一区分影响失败解释:DROID 的约 16k 失败轨迹是人工全程遥操作失败;LeRobot HIL 才是既有策略 rollout 中的暂停、接管、恢复和纠正。两者对应不同 control authority 与状态分布,不能合并成一个“人类反馈”类别。
证据:原始资料快照(本地归档)
LeRobot DAgger 的记录单元与评测口径(2026-08-10)
| 模式 | 数据集中的 episode 单元 | 可直接观察 | 不能直接推出 |
|---|---|---|---|
| 默认 corrections-only | 一次 CORRECTING→PAUSED 的人工纠错窗口 | 纠错观测、人工动作与 intervention=true |
介入率、首次介入前自主时长、任务结果 |
显式 record_autonomous=true |
按视频目标大小估算的 wall-clock 切片;纠错期间延迟切片 | 自主/人工帧序列和帧级控制权占比 | 任务 episode、真实暂停时长、autonomous success |
统一的 action 会随阶段改变来源:自主帧来自策略,纠错帧来自 teleoperator;它在最终 robot action processor 之前写入,不是独立的硬件执行反馈。纠错时策略推理暂停,因而也没有与人工动作同时记录的 counterfactual policy action。当前 schema 还缺介入原因、恢复/纠正子阶段和 outcome。
因此,intervention=true 不能自动解释为策略失败,包含人工接管后完成的轨迹也只能计为 assisted completion。开放 PR #3914 提议补 next.success 与任务级保存/重置,但截至 2026-08-10 尚未合并,不能当作 v0.6.1 或 main 的现有能力。
证据:原始资料快照(本地归档)
规模化视频路线不能按小时数排序(2026-08-10)
人类视频到机器人策略学习进一步把 2025–2026 年路线分成四级:EgoLive 是感知语料;VITRA、EgoVerse 与 EgoScale Stage I 重建人手/腕/相机 pose;Ego2Robot 与 EgoEngine 合成机器人画面或可执行动作;EgoScale Stage II、VITRA fine-tune、EgoVerse 与 EgoHumanoid 则重新引入目标机器人数据或 task-specific simulation。
这些规模不能相加:
- VITRA 的 1,222,918 episodes 来自 Ego4D、Ego-Exo4D、EPIC 与 SSv2,不是额外新拍的一百万条活动。
- Ego2Robot 的 18,561h 是约 1,942h 输入经 15 种形态复制后的 synthetic morphology-hours,还重复使用 VITRA、EgoVerse 与 EgoDex。
- EgoScale 的 20,854h 中只有 829h EgoDex 可指认,其余 20,025h 没有公开 source manifest。
- EgoVerse 是 living dataset,论文快照与 live explorer 已发生规模漂移,引用必须带日期和版本。
- EgoLive 没有 robot action 或 policy;它的数据规模不能当作机器人策略训练效果。
跨路线反例指向同一边界:EgoVerse 在一个平台的 bag-grocery 上退化;Ego2Robot 某些 mixture 和 unseen Franka 低于 robot-only;EgoHumanoid 的 human-only 对精细操作失败;VITRA 在新域未经 mid-training 时出现显著 wrist-scale 误差。人类视频能提供覆盖和先验,但 alignment、目标本体 grounding、接触与安全验证仍是独立必要条件。
证据:原始资料快照(本地归档)
人类示范数据的许可不是二元开源标签(2026-08-10)
EgoMimic 与 Project Aria 的固定版本审计表明,人类示范数据至少要分开记录四层:
- 工具与代码:MIT/Apache-2.0 只覆盖被许可的软件对象。
- 采集治理:参与者、旁观者、场地方、录制模态、通知/同意、留存、删除、去标识和第三方知识产权由项目特定流程承担。
- 数据集许可:训练、站外再分发、商业用途、衍生数据和模型用途需要数据集自己的协议或权利方说明。
- 托管平台:公开仓库的访问和平台服务条款不应被冒充为仓库专属 MIT/CC 许可。
EgoMimic 的代码仓根许可为 MIT;HF main@065ffc0 的六个 HDF5 可公开、非 gated 下载,官方 README 也演示训练。但该 revision 没有 dataset card、LICENSE 或 license tag,项目公开材料也没有给出 IRB/同意/影像发布与撤回传播记录。因此其 dataset-specific license、站外再分发、商用训练和参与者授权范围均应写为 needs_verification。这个结论既不证明研究者未取得同意,也不允许把沉默推定为授权。
Project Aria 原始设备能够产生音频、眼相机和其他传感流,不表示公开训练 HDF5 一定保留它们;人体或传感器衍生数据也不能在没有项目评估时自动贴成某种 biometric 分类。数据清单必须记录“实际发布字段”,不能用设备最大能力替代 artifact 级核验。
证据:原始资料快照(本地归档)