具身智能数据基础设施

具身智能数据基础设施

具身智能的核心竞争正在从“有没有模型/本体”转向“能否持续获得真实世界数据”。这里的数据不只是视频规模,而包括带有明确标签来源的任务/意图数据、力触觉、肌电/脑电、第一视角闭环、真实用户反馈、标准化格式、处理溯源、伦理授权和产业采集能力。

当前判断

人类活动到机器人策略的闭环证据

详见 人类活动数据 与 原始资料快照(本地归档)。

可复用框架

目前可以按数据角色分层;以下类别可以并列,并非互斥:

真正的瓶颈可能不是单一类型数据不足,而是这些数据如何被同步、标注、标准化、合规共享并转化成可评测的模型改进。

截至 2026-08-10 的结论与结题证据

相关页面

补充证据

2026-08-10 人类活动到机器人训练的四层数据链

人类活动数据 的新证据把“人类数据”拆成四层:Ego4D 的自然第一视角活动扩展任务分布;Ego-Exo4D 用同步第三视角、3D 手/身体和步骤标注增加技能监督;EgoMimicUMI 通过相似视角、相对动作或手持夹爪把人类示范翻译为机器人可用监督;HIL-SERL 与 LeRobot HIL 则在真机部署中记录自动行为、人工接管和失败恢复。

这四层不能用“小时数”直接排名。自然视频缺机器人动作,接口示范受运动学、时延、SLAM 与触觉限制,HIL 数据又受策略访问状态和人工接管选择偏差影响。基础设施比较至少同时记录原始单位、动作表示、训练/测试本体、场景留出、失败轨迹、参与者同意、数据许可与撤回传播。

RoHIL 的 2026 年结果进一步表明,训练工作台上接近满分的 HIL-RL 策略可能因附近工作台的光照变化而失效;部署反馈只有在跨环境评测和无人工接管指标下才构成稳健性证据。

证据:原始资料快照(本地归档)

2026-08-10 补强:控制权、状态分布与动作真值

机器人数据不能只按“人类数据/机器人数据”二分。更有解释力的主轴是:

数据来源 谁控制 状态分布 原生机器人动作 主要价值
Ego4DEgo-Exo4D 人控制自己的身体 自然人类活动 覆盖、表征、技能与几何先验
EgoMimic 人和机器人分别示范 任务内人类 + 遥操作分布 只在机器人侧有 人机共享表示与少量 robot data 落地
UMIFastUMI 人操作类机器人末端 接口约束的人类任务分布 相对 EEF ��迹接近 robot-compatible 低成本采集与动作对齐
DROID 人全程遥操作机器人 teleoperator 选择的机器人状态 大规模部署前示范
LeRobot HIL、HIL-SERL 策略自主与人局部接管 当前策略真正访问的状态 失败邻域、recovery 与 correction

DROID 的失败轨迹是人工遥操作失败,不能写成 policy deployment failures。LeRobot HIL 也不必然保存完整 autonomous rollout:v0.6.0 默认只记录 correction windows。数据基础设施若不记录 control_authority、autonomous/intervention 分段、目标本体、动作表示、时延、失败与许可,就会把训练前示范、策略失败和人类反馈错误地合成一个“数据闭环”。

这也解释了规模与可执行性的权衡:自然视频便宜且覆盖广,但离 robot action 远;接口约束示范更可执行,却改变了人的自然动作;机器人遥操作和 HIL 最贴近部署,成本、安全和选择偏差也最高。EgoScaleEgo2Robot等 2026 路线试图用动作重定向、视觉合成和 embodiment adapters 改变这条成本曲线,目前仍以作者证据为主。

人类活动到机器人动作的转换链(2026-08-10)

人类活动数据 的新增证据把“人类数据”拆成四层:Ego4D 的自然第一视角活动提供场景与表征先验;Ego-Exo4D 的同步多视角、姿态和步骤标注增加几何/过程监督;EgoMimicUMI 通过共同表示或接口约束把人的动作映射到特定机器人动作空间;HIL-SERL 与 LeRobot HIL 则直接采集机器人部署中的失败、恢复和纠正。真正的基础设施不是把视频小时数做大,而是让动作语义、坐标系、时延、运动学、力触觉、许可和真机评测连成可审计链。

作者结果与外部证据必须分开:Ego4D 有 R3M 等表征迁移使用,但不提供机器人动作;EgoMimic/UMI 有作者真机结果,尚缺同协议跨团队复现;LeRobot DAgger 有可运行文档,却缺精确实现的独立增益评测。证据与检索边界见 原始资料快照(本地归档)。

2026-08-10 开放机器人学习数据集与格式基线

基础设施范式 代表对象 主要解决什么 不能据此推出什么
跨机构异构联盟 Open X-Embodiment 让多实验室、多本体数据进入共同 RLDS/训练管线 动作坐标、质量、task ontology 与许可已经统一
同构硬件分布式采集 DROID 数据集 用标准 Franka 套件扩大地点、场景和操作者分布 18 套采集系统等于 18 种本体;人工失败等于策略失败
格式与运行时 LeRobotDataset 用 Parquet、MP4、关系型 metadata 和 streaming 统一存取接口 它有一个可按总轨迹排名的 corpus;转换后许可变成 Apache-2.0
垂直整合人形语料 AgiBot World 在同构 G1/G2 平台连接采集、标注、模型与 benchmark 100+ robot units 等于 100+ embodiments;2026 自动继承 2025 规模

比较这四条路线时必须分列 trajectories/episodes、hours、task instances/语义任务类、skills、scenes、robot units/setups/embodiments 和 TB。RLDS 或 LeRobot 统一的是存储包络,不会自动统一坐标系、absolute/delta/velocity action、控制频率、标定、失败筛选、任务语义和许可证。

证据层也应分开:作者模型结果、外部采用、独立同协议复现和独立负结果不是同一等级。DROID 官方上游与 LeRobot 转换镜像的计数及许可冲突由 Bead luwiki-4i3.1.1 单独追踪。

证据:原始资料快照(本地归档)