Ego2Robot

Ego2Robot 是 2026-08-03 发布的第一视角人类视频到机器人格式训练数据的预印本路线。它把转换拆成动作重定向、机器人手臂视觉合成和多层质量筛选,而不是假设原视频已经包含可执行 robot action。

规模口径

论文的原始输入约为 1,942 小时:

来源 原始小时
ANT 7
EgoDex 732
VITRA 249
EgoVerse 954

这些视频经速度处理、质量筛选并在 15 种机器人形态上分别渲染后,形成 18,561 synthetic robot morphology-hours。这个数字不是 18,561 小时独立人类行为;按单形态折算约 1,237 小时,而且与 VITRA、EgoVerse、EgoDex 的规模重叠,不能相加成新的行为总量。

从人体 pose 到机器人样本

  1. 对已有或未标注视频取得手姿;后者使用 WiLoR 与 DynHaMR 估计,并由 Qwen3.5 切分任务和生成描述。
  2. 把 21 点手姿映射为 parallel-gripper EEF trajectory,做时序平滑和 source-specific speed alignment。
  3. 用 SAM3 分割手臂、ProPainter 去除人体,再对目标本体搜索 base pose、用 MuJoCo IK 求解并做 depth-aware compositing。
  4. 以 IK/碰撞/workspace、统计异常和 VLM semantic consistency 做三层过滤。
  5. 每个样本包含 robot-composited frame、camera-frame relative EEF action、相机参数与 instruction。

支持的 15 种形态包括 Panda、UR5e、ARX-L5、xArm7、Sawyer、Kinova、IIWA、Jaco、FR3、UR10e、ViperX、WidowX、Piper、YAM 与 Aloha。合成动作比原始视频更接近目标机器人格式,但仍不包含真实接触力、执行时延、控制误差或安全结果。

训练与作者结果

预训练还使用 6,565 小时 robot pool:DROID 511h real、AgiBotWorld 2,404h real、InternData 3,650h simulation。因此约 55.6% 的所谓 robot pool 是仿真,不能写成 6,565h 真实机器人数据。

所有配置固定 200k steps 和相同样本数,比较 Ego2R:Robot 为 1:3、3:1、1:1 的采样权重,再用 RoboTwin2.0 的 50 tasks×50 demos 和 EBench 7 tasks×400 demos 微调。1:1 相对 robot-only 在 Clean、Visual、Scene、Task 有改善,但并非单调:

真机 ARX ACone 的五项任务仍使用每任务 20 robot demos,并加入约 35 分钟 ego play 生成的 675 episodes;这不是 robot-data-free 或 zero-shot 部署。

开放性与证据边界

因此 Ego2Robot 的证据支持“目标本体渲染和动作合成可以作为有条件的预训练扩增”,不支持把 morphology-hours 当作新的独立经验,也不支持视觉合成已经解决动力学与接触差距。

相关页面

证据