人形机器人基础模型
人形机器人基础模型
人形机器人基础模型指面向移动、操作、双臂协同、全身控制和长程任务的可迁移机器人模型。它不是把视觉语言模型直接接到动作 token 上,而是要解决人类操作先验、机器人 embodiment 对齐、真实轨迹后训练和物理后果预测之间的系统关系。
观察
- 人形机器人任务天然比桌面单臂操作更接近 全身智能:机器人要移动身体、协调双臂、保持平衡、处理接触和长程误差累积。
- Psi-0 的分阶段训练路线提供了一个清晰框架:先用第一视角人类视频学习操作和交互先验,再用真实人形机器人轨迹完成 embodiment 对齐,最后用少量目标任务数据做适配。
- Humanoid Everyday 把问题推进到 具身智能数据基础设施:开放世界人形操作需要覆盖日常任务、多模态感知、真实轨迹和可复现评测,而不是只展示单一 demo。
- PhysWorld 把 世界模型 接回机器人控制:如果未来预测不能转成可执行轨迹,它仍主要是生成模型;只有进入控制闭环,才对机器人任务产生直接价值。
- PSI Lab 的三个相邻工作说明,人形机器人基础能力可能来自数据底座、机器人原生模型和物理世界预测之间的配合,而不只是模型规模继续放大。
- 世界模型技术路线 把 embodied world model 放到路线分化中:人形机器人基础模型需要同时处理人类视频先验、机器人轨迹、动作条件预测和现实反馈。
- 人形机器人实景实训专项行动 从政策侧提出真实场景验证要求,说明人形机器人基础模型最终必须面对作业成功率、效率、安全、经济性和常态部署,而不是只在 benchmark 上比较。
- 人形机器人供应链 从硬件侧约束基础模型:执行器、传感器、控制器、材料和接口标准决定了模型输出能否被稳定、低成本、可认证地转成全身动作。
人类数据迁移的证据层级
- Ego4D 的 R3M/V-PTR 证据主要是表征或价值预训练,仍需机器人 transition 与目标示范。
- Ego-Exo4D 的 TriHands 先重建 3D 手轨迹,再做相机/动作映射并加入目标机器人示范;多视角数据不会自动产生全身人形控制。
- EgoMimic 与 Universal Manipulation Interface 的实证主要来自桌面机械臂和末端执行器。它们说明动作表示与本体 grounding 的必要性,不能直接外推为人形机器人的平衡、移动、全身接触或跨本体能力。
- 人形基础模型仍需机器人原生全身轨迹、关节/力触觉、部署失败和安全验证。
边界
- “基础模型”不等于已经具备通用人形机器人能力。公开数据集、云端评测、项目页和论文只能说明研究方向,真实家庭/工业部署还需要长期验证。
- 人类第一视角视频能提供操作先验,但人和人形机器人身体结构不同,embodiment gap 是必须显式处理的技术边界。
- 政策场景开放能提供数据和验证机会,但不能替代模型自身的跨场景泛化能力。
相关页面
证据
- 原始资料快照(本地归档)
- Psi-0
- Humanoid Everyday
- PhysWorld arXiv
- 世界模型技术路线
- 人形机器人实景实训专项行动
- 人形机器人供应链
2026-08-10 补强:人类视频预训练的本体边界
EgoScale与Ego2Robot代表 2026 年扩大人类第一视角视频预训练的两种尝试:前者使用统一腕部表示、embodiment adapters 与人机对齐中训;后者加入动作重定向、机器人手臂视觉合成和质量筛选。它们都没有把人类视频直接当作人形机器人控制真值。
对人形机器人尤其要保留全身本体差距:腕部或手部轨迹不能提供重心、足地接触、全身动力学、关节力矩、安全状态和跌倒恢复。两条路线截至 2026-08-10 都以作者结果为主;EgoScale 官方代码仍标 Coming Soon,Ego2Robot 是一周前发布的预印本。本体适配、真实机器人数据和全身闭环评测仍不可省略。
2026-08-10 开放数据基线对人形模型的约束
Open X-Embodiment 与 DROID 数据集 的主体仍是机械臂操作经验;它们的轨迹规模不能自动外推为全身人形控制能力。AgiBot World 的区别在于同构 G1/G2、双臂、底盘、腰部与全身遥操作数据,但 100 多台采集机器人仍是一种平台规模,不是本体多样性。
人形基础模型的证据应把数据规模与模型效果分开:腕部/末端轨迹不提供重心、足地接触、全身动力学、关节力矩、跌倒恢复和安全状态;GO-1、RT-X 等定量结果保留作者归属。商业可用性也不同:DROID 上游为 attribution 许可,AgiBot World 使用含 NonCommercial 和 ShareAlike 的条款,不能用“开放”一词抹平。
证据:原始资料快照(本地归档)
合成 GR1 轨迹能证明什么(2026-08-10)
DreamGen 在 GR1 四项真机任务中,用约 10 条真实示范/任务(折叠为 25)加每任务 300 条合成轨迹,将 GR00T N1 作者平均分约从 37 提升到 46/46.4;RLDX-1 在 GR1 Tabletop 仿真控制消融中,从无合成 41.0 提升到完整 150K 合成 50.1。二者支持受真实本体数据校准的合成扩增,但不能推出零真实数据的人形基础模型。
边界有三层:DreamGen 每 checkpoint/task 仅 10 次真机 rollout 且允许 partial credit;RLDX-1 的可归因消融是仿真并在每任务 1,000 条 simulator demos 上继续微调;两条链都需要真实视频训练 WFM/IDM 或动作一致性过滤器。当前证据覆盖上肢操作,不覆盖足地接触、平衡、跌倒恢复和全身动力学。
证据:原始资料快照(本地归档)、DreamGen、RLDX-1。
人类第一视角共同训练的本体边界(2026-08-10)
EgoHumanoid把人类第一视角示范用于 Unitree G1 loco-manipulation。四任务每项约 100 robot + 300 human episodes,human corpus 比例为 3:1;模型训练另比较 Robot:Human 1:2、1:1、2:1 的 minibatch ratio,粗导航与精细操作的最佳比例不同。
作者报告 in-domain 约 59→78,所谓 generalized environments 31→82;但这些场景已出现在 human training demonstrations,只是 robot branch 未见,不能写成全训练 scene-held-out。human-only 在 Cart Stowing 的精细后段仅 5/0/0,而 co-training 为 60/50/50,说明人体运动先验可以迁移导航和粗粒度操作,却不能替代目标手的精确接触与夹持标签。
EgoScale也报告 G1 transfer,但仍经过 aligned human-robot mid-training;Ego2Robot在 unseen Franka 上没有超过 robot-only。当前证据更适合支持“可共享运动先验 + 本体专属落地”,而不是 embodiment gap 已被消除。
证据:原始资料快照(本地归档)