人形机器人基础模型
人形机器人基础模型
人形机器人基础模型指面向移动、操作、双臂协同、全身控制和长程任务的可迁移机器人模型。它不是把视觉语言模型直接接到动作 token 上,而是要解决人类操作先验、机器人 embodiment 对齐、真实轨迹后训练和物理后果预测之间的系统关系。
观察
- 人形机器人任务天然比桌面单臂操作更接近 全身智能:机器人要移动身体、协调双臂、保持平衡、处理接触和长程误差累积。
- Psi-0 的分阶段训练路线提供了一个清晰框架:先用第一视角人类视频学习操作和交互先验,再用真实人形机器人轨迹完成 embodiment 对齐,最后用少量目标任务数据做适配。
- Humanoid Everyday 把问题推进到 具身智能数据基础设施:开放世界人形操作需要覆盖日常任务、多模态感知、真实轨迹和可复现评测,而不是只展示单一 demo。
- PhysWorld 把 世界模型 接回机器人控制:如果未来预测不能转成可执行轨迹,它仍主要是生成模型;只有进入控制闭环,才对机器人任务产生直接价值。
- PSI Lab 的三个相邻工作说明,人形机器人基础能力可能来自数据底座、机器人原生模型和物理世界预测之间的配合,而不只是模型规模继续放大。
- 世界模型技术路线 把 embodied world model 放到路线分化中:人形机器人基础模型需要同时处理人类视频先验、机器人轨迹、动作条件预测和现实反馈。
- 人形机器人实景实训专项行动 从政策侧提出真实场景验证要求,说明人形机器人基础模型最终必须面对作业成功率、效率、安全、经济性和常态部署,而不是只在 benchmark 上比较。
- 人形机器人供应链 从硬件侧约束基础模型:执行器、传感器、控制器、材料和接口标准决定了模型输出能否被稳定、低成本、可认证地转成全身动作。
人类数据迁移的证据层级
- Ego4D 的 R3M/V-PTR 证据主要是表征或价值预训练,仍需机器人 transition 与目标示范。
- Ego-Exo4D 的 TriHands 先重建 3D 手轨迹,再做相机/动作映射并加入目标机器人示范;多视角数据不会自动产生全身人形控制。
- EgoMimic 与 Universal Manipulation Interface 的实证主要来自桌面机械臂和末端执行器。它们说明动作表示与本体 grounding 的必要性,不能直接外推为人形机器人的平衡、移动、全身接触或跨本体能力。
- 人形基础模型仍需机器人原生全身轨迹、关节/力触觉、部署失败和安全验证。
边界
- “基础模型”不等于已经具备通用人形机器人能力。公开数据集、云端评测、项目页和论文只能说明研究方向,真实家庭/工业部署还需要长期验证。
- 人类第一视角视频能提供操作先验,但人和人形机器人身体结构不同,embodiment gap 是必须显式处理的技术边界。
- 政策场景开放能提供数据和验证机会,但不能替代模型自身的跨场景泛化能力。
相关页面
证据
- 原始资料快照(本地归档)
- Psi-0
- Humanoid Everyday
- PhysWorld arXiv
- 世界模型技术路线
- 人形机器人实景实训专项行动
- 人形机器人供应链
2026-08-10 补强:人类视频预训练的本体边界
EgoScale与Ego2Robot代表 2026 年扩大人类第一视角视频预训练的两种尝试:前者使用统一腕部表示、embodiment adapters 与人机对齐中训;后者加入动作重定向、机器人手臂视觉合成和质量筛选。它们都没有把人类视频直接当作人形机器人控制真值。
对人形机器人尤其要保留全身本体差距:腕部或手部轨迹不能提供重心、足地接触、全身动力学、关节力矩、安全状态和跌倒恢复。两条路线截至 2026-08-10 都以作者结果为主;EgoScale 官方代码仍标 Coming Soon,Ego2Robot 是一周前发布的预印本。本体适配、真实机器人数据和全身闭环评测仍不可省略。
2026-08-10 开放数据基线对人形模型的约束
Open X-Embodiment 与 DROID 数据集 的主体仍是机械臂操作经验;它们的轨迹规模不能自动外推为全身人形控制能力。AgiBot World 的区别在于同构 G1/G2、双臂、底盘、腰部与全身遥操作数据,但 100 多台采集机器人仍是一种平台规模,不是本体多样性。
人形基础模型的证据应把数据规模与模型效果分开:腕部/末端轨迹不提供重心、足地接触、全身动力学、关节力矩、跌倒恢复和安全状态;GO-1、RT-X 等定量结果保留作者归属。商业可用性也不同:DROID 上游为 attribution 许可,AgiBot World 使用含 NonCommercial 和 ShareAlike 的条款,不能用“开放”一词抹平。
证据:原始资料快照(本地归档)