人形机器人基础模型

人形机器人基础模型

人形机器人基础模型指面向移动、操作、双臂协同、全身控制和长程任务的可迁移机器人模型。它不是把视觉语言模型直接接到动作 token 上,而是要解决人类操作先验、机器人 embodiment 对齐、真实轨迹后训练和物理后果预测之间的系统关系。

观察

人类数据迁移的证据层级

边界

相关页面

证据

2026-08-10 补强:人类视频预训练的本体边界

EgoScaleEgo2Robot代表 2026 年扩大人类第一视角视频预训练的两种尝试:前者使用统一腕部表示、embodiment adapters 与人机对齐中训;后者加入动作重定向、机器人手臂视觉合成和质量筛选。它们都没有把人类视频直接当作人形机器人控制真值。

对人形机器人尤其要保留全身本体差距:腕部或手部轨迹不能提供重心、足地接触、全身动力学、关节力矩、安全状态和跌倒恢复。两条路线截至 2026-08-10 都以作者结果为主;EgoScale 官方代码仍标 Coming Soon,Ego2Robot 是一周前发布的预印本。本体适配、真实机器人数据和全身闭环评测仍不可省略。

2026-08-10 开放数据基线对人形模型的约束

Open X-EmbodimentDROID 数据集 的主体仍是机械臂操作经验;它们的轨迹规模不能自动外推为全身人形控制能力。AgiBot World 的区别在于同构 G1/G2、双臂、底盘、腰部与全身遥操作数据,但 100 多台采集机器人仍是一种平台规模,不是本体多样性。

人形基础模型的证据应把数据规模与模型效果分开:腕部/末端轨迹不提供重心、足地接触、全身动力学、关节力矩、跌倒恢复和安全状态;GO-1、RT-X 等定量结果保留作者归属。商业可用性也不同:DROID 上游为 attribution 许可,AgiBot World 使用含 NonCommercial 和 ShareAlike 的条款,不能用“开放”一词抹平。

证据:原始资料快照(本地归档)

合成 GR1 轨迹能证明什么(2026-08-10)

DreamGen 在 GR1 四项真机任务中,用约 10 条真实示范/任务(折叠为 25)加每任务 300 条合成轨迹,将 GR00T N1 作者平均分约从 37 提升到 46/46.4;RLDX-1 在 GR1 Tabletop 仿真控制消融中,从无合成 41.0 提升到完整 150K 合成 50.1。二者支持受真实本体数据校准的合成扩增,但不能推出零真实数据的人形基础模型。

边界有三层:DreamGen 每 checkpoint/task 仅 10 次真机 rollout 且允许 partial credit;RLDX-1 的可归因消融是仿真并在每任务 1,000 条 simulator demos 上继续微调;两条链都需要真实视频训练 WFM/IDM 或动作一致性过滤器。当前证据覆盖上肢操作,不覆盖足地接触、平衡、跌倒恢复和全身动力学。

证据:原始资料快照(本地归档)、DreamGenRLDX-1

人类第一视角共同训练的本体边界(2026-08-10)

EgoHumanoid把人类第一视角示范用于 Unitree G1 loco-manipulation。四任务每项约 100 robot + 300 human episodes,human corpus 比例为 3:1;模型训练另比较 Robot:Human 1:2、1:1、2:1 的 minibatch ratio,粗导航与精细操作的最佳比例不同。

作者报告 in-domain 约 59→78,所谓 generalized environments 31→82;但这些场景已出现在 human training demonstrations,只是 robot branch 未见,不能写成全训练 scene-held-out。human-only 在 Cart Stowing 的精细后段仅 5/0/0,而 co-training 为 60/50/50,说明人体运动先验可以迁移导航和粗粒度操作,却不能替代目标手的精确接触与夹持标签。

EgoScale也报告 G1 transfer,但仍经过 aligned human-robot mid-training;Ego2Robot在 unseen Franka 上没有超过 robot-only。当前证据更适合支持“可共享运动先验 + 本体专属落地”,而不是 embodiment gap 已被消除。

证据:原始资料快照(本地归档)