人类活动数据

人类活动数据

人类活动数据是人在真实物理世界中产生的视角、动作、身体轨迹、工具使用、接触、任务上下文和纠错记录。它对机器人学习的价值主要是提供规模、环境多样性和人类技能先验;它不是天然的机器人控制数据,必须经过动作代理重建、本体对齐、机器人数据落地和部署纠错才能进入可执行策略。

六级控制权与动作真值谱系

典型对象 控制权与原生动作 能直接提供什么 仍不能直接提供什么
自然第一视角观察 Ego4D 人控制自己的身体;无机器人原生动作 视觉、语义、时序、任务分布与手—物关系 机器人 proprioception、force、reward 和安全结果
结构化 ego/exo 技能记录 Ego-Exo4D 人控制自己的身体;无机器人原生动作 同步多视角、3D 手/身体、技能步骤与几何对应 目标机器人的关节可达性、接触与动力学
human+robot 共同训练 EgoMimic 人和机器人分别示范;原生动作只在机器人侧 共享 pose 语义、环境多样性与少量 robot data grounding 任意新本体的零样本可执行性
接口约束人类示范 Universal Manipulation Interface 人操作类机器人末端;得到 robot-compatible 动作代理 末端轨迹、夹爪状态、相对动作与时间对齐 目标机器人原生关节、碰撞、动力学与触觉真值
真机遥操作 DROID 数据集 人全程控制目标机器人;有机器人原生状态和动作 部署前示范、失败 episode 与同本体多场景覆盖 当前策略自己会访问的失败状态和介入上下文
策略部署局部接管 HIL-SERL、LeRobot HIL 等 策略自主与人局部接管;有实际执行动作 on-policy 失败邻域、恢复、纠正与控制权切换 schema 缺失时的策略反事实动作、介入原因和自主 outcome

自然与结构化不是证据等级高低,而是采集目的不同。Ego4D 更接近日常 in-the-wild 观察;Ego-Exo4D 是自然场景中的预定义熟练活动;EgoMimicUniversal Manipulation Interface 则是明确任务目标下的策划式示范。

从视频到策略的转换链

  1. 观察先验:人类视频先学习视觉表征、任务阶段、对象关系或价值函数。R3M 与 V-PTR 说明这一路线可以改善机器人下游数据效率,但两者都还需要机器人 transition 或目标任务示范。
  2. 动作代理:3D 手轨迹、工具中心坐标、机器人化夹爪或视觉流把“人做了什么”压成可映射的 pose/trajectory。带 3D、IMU 或 gaze 不等于已经有机器人 action。
  3. 视觉与运动学对齐:相机尺度、视角、手/夹爪外观、动作归一化、relative trajectory 和本体专属网络分别处理不同的 embodiment gap。
  4. 机器人落地:目标机器人的关节范围、碰撞、控制频率、传感器延迟和接触动力学必须由真机数据或明确约束补足。
  5. 部署闭环:只有在当前策略 rollout 中记录自主段、接管、恢复、纠正和 outcome,数据才覆盖模型自己的失败分布。

已核验的结果与反例

UMI 后续的规模、3D 与触觉边界(2026-08-10)

UMI 的后续不是把同一条链依次“补全”,而是在采集吞吐、轨迹标签、末端同构和接触监督上做不同交换:

系统 人的控制与动作代理 新增信息 策略实际消费 当前证据边界
FastUMI 人手持平行夹爪,T265 生成 EEF pose 统一 ROS 时间、标准化安装;后续扩到单/双臂 RGB、relative TCP;深度版还消费估计深度 原版从论文10k/22扩到15k/24;100K论文总体与公开34,052条双臂子集不能混写
UMI-3D 人手持平行夹爪,LiDAR-inertial SLAM 生成公制轨迹 LiDAR、IMU、硬件触发相机与3D地图 当前公开策略只有 RGB+proprio 3D改善的是采集/标签,不是已发布点云策略;最终长任务放置仅5%暴露运动学约束
DexUMI 人佩戴目标机器人手专用外骨骼,编码器映射手关节 ARKit腕位姿、RGB与手型特定触觉 处理后的 robot-hand RGB+可选触觉 需要真实目标手 replay;触觉只在干净 salt force cue 上有明显增益,其他比较常无益或变差
TacUMI(多模态事件分割) 人双手操作线缆,左右设备非对称 触觉、F/T、RGB-D与双手 pose 没有操控策略;信号进入离线事件分割器 单任务约30k frames;机器人侧 cross-platform 只是分割测试,不是控制迁移

因此,“人类活动数据更丰富”至少要拆成四个问题:是否更快覆盖任务;是否更准确恢复动作标签;是否与目标末端执行器同构;新增模态是否进入训练和部署观测。采集端有 LiDAR、触觉或力觉,不能自动提升为策略模态;relative SE(3) 也不能消除工作空间、关节极限、外骨骼几何、接触动力学和时延。

证据:原始资料快照(本地归档)

数据质量与评测

许可与人的权利

相关页面

证据

2026-08-10 与机器人原生开放数据的边界

Open X-EmbodimentDROID 数据集LeRobotDatasetAgiBot World 主要属于机器人原生示范、遥操作、格式或平台基础设施,不属于纯人类活动视频语料。AgiBot 的 VR/全身 mocap 是控制机器人采集轨迹的接口,不能因为操作者是人就把整库归入自然人类活动数据。

这一区分影响失败解释:DROID 的约 16k 失败轨迹是人工全程遥操作失败;LeRobot HIL 才是既有策略 rollout 中的暂停、接管、恢复和纠正。两者对应不同 control authority 与状态分布,不能合并成一个“人类反馈”类别。

证据:原始资料快照(本地归档)

LeRobot DAgger 的记录单元与评测口径(2026-08-10)

模式 数据集中的 episode 单元 可直接观察 不能直接推出
默认 corrections-only 一次 CORRECTING→PAUSED 的人工纠错窗口 纠错观测、人工动作与 intervention=true 介入率、首次介入前自主时长、任务结果
显式 record_autonomous=true 按视频目标大小估算的 wall-clock 切片;纠错期间延迟切片 自主/人工帧序列和帧级控制权占比 任务 episode、真实暂停时长、autonomous success

统一的 action 会随阶段改变来源:自主帧来自策略,纠错帧来自 teleoperator;它在最终 robot action processor 之前写入,不是独立的硬件执行反馈。纠错时策略推理暂停,因而也没有与人工动作同时记录的 counterfactual policy action。当前 schema 还缺介入原因、恢复/纠正子阶段和 outcome。

因此,intervention=true 不能自动解释为策略失败,包含人工接管后完成的轨迹也只能计为 assisted completion。开放 PR #3914 提议补 next.success 与任务级保存/重置,但截至 2026-08-10 尚未合并,不能当作 v0.6.1 或 main 的现有能力。

证据:原始资料快照(本地归档)

规模化视频路线不能按小时数排序(2026-08-10)

人类视频到机器人策略学习进一步把 2025–2026 年路线分成四级:EgoLive 是感知语料;VITRAEgoVerseEgoScale Stage I 重建人手/腕/相机 pose;Ego2RobotEgoEngine 合成机器人画面或可执行动作;EgoScale Stage II、VITRA fine-tune、EgoVerse 与 EgoHumanoid 则重新引入目标机器人数据或 task-specific simulation。

这些规模不能相加:

跨路线反例指向同一边界:EgoVerse 在一个平台的 bag-grocery 上退化;Ego2Robot 某些 mixture 和 unseen Franka 低于 robot-only;EgoHumanoid 的 human-only 对精细操作失败;VITRA 在新域未经 mid-training 时出现显著 wrist-scale 误差。人类视频能提供覆盖和先验,但 alignment、目标本体 grounding、接触与安全验证仍是独立必要条件。

证据:原始资料快照(本地归档)

人类示范数据的许可不是二元开源标签(2026-08-10)

EgoMimicProject Aria 的固定版本审计表明,人类示范数据至少要分开记录四层:

  1. 工具与代码:MIT/Apache-2.0 只覆盖被许可的软件对象。
  2. 采集治理:参与者、旁观者、场地方、录制模态、通知/同意、留存、删除、去标识和第三方知识产权由项目特定流程承担。
  3. 数据集许可:训练、站外再分发、商业用途、衍生数据和模型用途需要数据集自己的协议或权利方说明。
  4. 托管平台:公开仓库的访问和平台服务条款不应被冒充为仓库专属 MIT/CC 许可。

EgoMimic 的代码仓根许可为 MIT;HF main@065ffc0 的六个 HDF5 可公开、非 gated 下载,官方 README 也演示训练。但该 revision 没有 dataset card、LICENSE 或 license tag,项目公开材料也没有给出 IRB/同意/影像发布与撤回传播记录。因此其 dataset-specific license、站外再分发、商用训练和参与者授权范围均应写为 needs_verification。这个结论既不证明研究者未取得同意,也不允许把沉默推定为授权。

Project Aria 原始设备能够产生音频、眼相机和其他传感流,不表示公开训练 HDF5 一定保留它们;人体或传感器衍生数据也不能在没有项目评估时自动贴成某种 biometric 分类。数据清单必须记录“实际发布字段”,不能用设备最大能力替代 artifact 级核验。

证据:原始资料快照(本地归档)