EgoScale

EgoScale 是 2026 年提出的第一视角人类视频到灵巧机器人策略的分阶段预训练路线。它的核心不是把原始视频直接当 robot action,而是先把估计的人类腕/手运动映射到统一表示,再用少量同场景、同视角的人类与机器人数据做对齐中训,最后以目标任务机器人示范后训练。

数据与动作真值

阶段 规模 标签来源 能支持的主张
Stage I 大规模预训练 20,854h、9,869 scenes、6,015 tasks、43,237 objects 其中 829h 为 EgoDex;其余 20,025h 来源未披露。相机位姿和 21 点手姿主要由 SLAM/hand-pose 模型估计,再重定向到 Sharpa 22-DoF 提供大规模视觉和人体运动先验,不是 robot-native action truth
Stage II aligned mid-training 344 tasks,约 50h human + 4h robot;每任务约 30 human + 5 robot trajectories 人体侧用 Vive wrist tracker 与 Manus gloves;机器人侧为对齐遥操作 把大语料与目标相机、本体和任务分布连接起来
Robot post-training 目标任务少量 robot demos 目标机器人原生示范 补充可达性、接触、控制与部署约束

论文没有披露 Stage II 的 minibatch sampling ratio。轨迹数约 6:1、小时约 12.5:1 都不能替代实际训练采样权重。

作者实验

作者用 256 张 GB200 训练 Stage I,再在 R1 Pro 双臂与双 22-DoF Sharpa hands 上评测 shirt rolling、tongs、card sorting、bottle unscrewing、syringe liquid transfer,并把策略迁移到 Unitree G1 的低 DoF 手。

作者报告 1k→20k 小时使 human validation completion 从约 0.30 升到 0.71,并在 1k–20k 五个规模点得到验证损失的高拟合度。最终策略相对 no-pretraining baseline 的平均成功率约提高 54%。这个 scaling 关系来自同一作者管线、有限规模点和 human validation loss,不能写成已获独立验证的普遍规律。

论文所称 one-shot 适配仍包含每个对象 100 条 aligned human demonstrations 和 1 条 robot demonstration;它不是整个任务只看一次人类或机器人示范。

外部证据与边界

因此 EgoScale 目前是证据强度较高但 artifact 不闭合的作者结果,页面保持 seed。

相关页面

证据