具身智能数据基础设施

具身智能数据基础设施

具身智能的核心竞争正在从“有没有模型/本体”转向“能否持续获得真实世界数据”。这里的数据不只是视频规模,而包括带有明确标签来源的任务/意图数据、力触觉、肌电/脑电、第一视角闭环、真实用户反馈、标准化格式、处理溯源、伦理授权和产业采集能力。

当前判断

人类活动到机器人策略的闭环证据

详见 人类活动数据 与 原始资料快照(本地归档)。

UMI 后续的多模态数据会计(2026-08-10)

UMIFastUMIUMI-3DDexUMITacUMI(多模态事件分割)说明,采集硬件、标签生成和策略观测必须分三层建账:

系统 规模口径 采集/标签层 策略观测层 必须保留的缺口
FastUMI arXiv 10k/22;PMLR 15k/24;公开 artifact 仍为22任务旧快照 GoPro+T265,ROS 时间与近邻 pose 匹配 RGB;深度版实际加入估计深度 论文版本、artifact revision、过滤保留率与动作 schema
FastUMI-100K 论文总体100k+/54/600h;当前公开34,052条双臂 episode、12任务、约178.6轨迹小时 单/双套 GoPro+T265,20Hz relative EEF action 腕部 RGB+相对末端动作 单臂/剩余任务 manifest、生成代码、对象规格与机器可读许可
UMI-3D 4609 demos,单臂平行夹爪 LiDAR+IMU+硬件触发相机生成公制 SE(3) 标签 当前只有 RGB+proprio 不能把采集端3D写成点云策略;需 ground-truth SLAM 与跨本体对照
DexUMI 公开登记1792 demos、每包单环境 目标手专用外骨骼、ARKit、RGB和触觉;真实机器人手 replay 后做视觉转换 处理后 RGB+可选触觉 每种手的映射、同步延迟、触觉漂移、转换依赖许可和原始到策略的 provenance
TacUMI(Cheng 等) 单任务约30k frames,未报轨迹/小时/操作者 非对称双手 F/T、触觉、Vive 与固定 RGB-D 无操控策略;离线分割器消费多模态输入 代码、数据、标签、划分、checkpoint与许可均未公开

基础设施至少应分别保存 collection_sensorlabel_sourcetraining_observationdeployment_observationaction_frameclock_and_alignmentrobot_hand_or_gripperdataset_revisionlicense_scopeevaluation_provenance。否则“有3D”“有触觉”“跨本体”和“100K”会把完全不同的事实折叠成营销标签。

作者跨平台结果、第三方组件复建和同协议独立复现也不能合并。FastUMI 只有 replay utility 与社区故障信号;UMI-3D 没有第三方完整复建;DexEXO 独立显示 DexUMI 外骨骼在剪刀任务上0成功率,但没有复现其视觉转换与策略全链;TacUMI 仍停在官方 artifact 不足以执行复算。

证据:原始资料快照(本地归档)

可复用框架

目前可以按数据角色分层;以下类别可以并列,并非互斥:

真正的瓶颈可能不是单一类型数据不足,而是这些数据如何被同步、标注、标准化、合规共享并转化成可评测的模型改进。

截至 2026-08-10 的结论与结题证据

相关页面

补充证据

2026-08-10 人类活动到机器人训练的六级谱系

人类活动数据 按控制权与动作真值把链路拆成六级:自然第一视角观察、结构化 ego/exo 技能记录、human+robot 共同训练、接口约束人类示范、真机遥操作、策略部署局部接管。前两级没有机器人原生动作;中间两级制造动作代理并用目标机器人约束落地;后两级才直接记录机器人执行,其中只有部署局部接管覆盖当前策略实际访问的失败邻域。

六级不能按“小时数”直接排名。自然视频缺机器人动作,接口示范受运动学、时延、SLAM 与触觉限制,遥操作失败不等于策略失败,HIL 数据又受记录配置、策略访问状态和人工接管选择偏差影响。基础设施比较至少同时记录原始单位、控制权、动作表示、训练/测试本体、场景留出、失败轨迹、参与者同意、数据许可与撤回传播。

证据:原始资料快照(本地归档)、原始资料快照(本地归档)

2026-08-10 补强:控制权、状态分布与动作真值

机器人数据不能只按“人类数据/机器人数据”二分。更有解释力的主轴是:

数据来源 谁控制 状态分布 原生机器人动作 主要价值
Ego4D 人控制自己的身体 自然日常第一视角分布 覆盖、表征与任务先验
Ego-Exo4D 人控制自己的身体 预定义熟练活动的同步多视角分布 技能步骤、姿态与几何对应
EgoMimic 人和机器人分别示范 任务内人类 + 遥操作分布 只在机器人侧有 人机共享表示与少量 robot data 落地
UMIFastUMI 人操作类机器人末端 接口约束的人类任务分布 相对 EEF 轨迹接近 robot-compatible 低成本采集与动作对齐
DROID 数据集 人全程遥操作机器人 teleoperator 选择的机器人状态 大规模部署前示范
LeRobot HIL、HIL-SERL 策略自主与人局部接管 当前策略真正访问的状态 失败邻域、recovery 与 correction

DROID 的失败轨迹是人工遥操作失败,不能写成 policy deployment failures。LeRobot HIL 也不必然保存完整 autonomous rollout:v0.6.0 默认只记录 correction windows。数据基础设施若不记录 control_authority、autonomous/intervention 分段、目标本体、动作表示、时延、失败与许可,就会把训练前示范、策略失败和人类反馈错误地合成一个“数据闭环”。

这也解释了规模与可执行性的权衡:自然视频便宜且覆盖广,但离 robot action 远;接口约束示范更可执行,却改变了人的自然动作;机器人遥操作和 HIL 最贴近部署,成本、安全和选择偏差也最高。EgoScaleEgo2Robot等 2026 路线试图用动作重定向、视觉合成和 embodiment adapters 改变这条成本曲线,目前仍以作者证据为主。

2026-08-10 开放机器人学习数据集与格式基线

基础设施范式 代表对象 主要解决什么 不能据此推出什么
跨机构异构联盟 Open X-Embodiment 让多实验室、多本体数据进入共同 RLDS/训练管线 动作坐标、质量、task ontology 与许可已经统一
同构硬件分布式采集 DROID 数据集 用标准 Franka 套件扩大地点、场景和操作者分布 18 套采集系统等于 18 种本体;人工失败等于策略失败
格式与运行时 LeRobotDataset 用 Parquet、MP4、关系型 metadata 和 streaming 统一存取接口 它有一个可按总轨迹排名的 corpus;转换后许可变成 Apache-2.0
垂直整合人形语料 AgiBot World 在同构 G1/G2 平台连接采集、标注、模型与 benchmark 100+ robot units 等于 100+ embodiments;2026 自动继承 2025 规模

比较这四条路线时必须分列 trajectories/episodes、hours、task instances/语义任务类、skills、scenes、robot units/setups/embodiments 和 TB。RLDS 或 LeRobot 统一的是存储包络,不会自动统一坐标系、absolute/delta/velocity action、控制频率、标定、失败筛选、任务语义和许可证。

证据层也应分开:作者模型结果、外部采用、独立同协议复现和独立负结果不是同一等级。DROID 子核验已经说明:LeRobot 镜像的 95,658 episodes 与官方 RLDS v1.0.1 一一对应,其中 78,864 成功、16,794 失败;49,630 是去重的主语言指令字符串(含空值),不是 86 个语义任务类。镜像 card 的 Apache-2.0 来自通用上传默认值,不能替代上游 CC BY 4.0。版本追踪进一步确认,76k 是 2024 年首发论文/项目页沿用的概数;RLDS 总量从 v1.0.0 的 92,233 变为 2025 年 v1.0.1 的 95,658,但上游未发布逐版成功/失败分拆、episode-ID diff 或增量原因。作者只明确说明 v1.0.1 补齐约 75k episode 的语言标注,不能据此把名义 2,864 差值写成已证实新增量。

证据:原始资料快照(本地归档)、原始资料快照(本地归档)、原始资料快照(本地归档)

合成轨迹的数据会计(2026-08-10)

合成数据基础设施不能只报最终视频或 episode 数量。DreamGenGR00T-DreamsRLDX-1 表明,至少要分别记录:

阶段 必要字段 为什么不能省略
真实校准数据 本体、任务、场景、轨迹数、小时、动作表示 决定 WFM、IDM 与策略对目标硬件知道什么
候选生成 模型/revision、初始帧、prompt、候选数、GPU-hours 候选视频不是可执行轨迹
视频过滤 指令遵循、视觉合理性、阈值、淘汰数、人审/API 成本 只控制媒体质量与任务偏离
动作恢复 IDM/LAPA 版本、训练 provenance、成功数 伪动作质量可独立于视频质量失败
可执行性过滤 模拟回放、运动一致性、关节/碰撞/接触约束、保留数 防止视觉连贯但动作不可执行
混合训练 原始计数比、batch 采样比、策略 checkpoint 1:333 的库存不等于 1:333 的训练权重
下游评测 真实/仿真、任务/本体/场景、rollout 数、严格成功与 partial progress 防止跨协议拼接效果量

DreamGen 240,000 条 RoboCasa 生成样本对应推导的 81,000 L40 GPU-hours,但候选到保留率未公开;RLDX-1 最终有 150,000 条过滤后合成 episode,也未公开候选数与逐级保留率。二者都按真实:合成=1:1 训练抽样的关键实验说明,合成库存规模不能代替 mixture 口径。

真实数据仍承担本体适配、IDM 监督、模拟回放参照、过滤器正例、策略微调和真机安全验证。当前证据支持受真实数据校准的扩增,不支持无真实数据替代。

证据:DreamGenGR00T-DreamsRLDX-1、原始资料快照(本地归档)。

人类视频转换链的数据会计(2026-08-10)

人类视频到机器人策略学习说明,人类视频数据基础设施至少要分别记录:

字段 必须分开的口径
原始经验 unique source videos、people、tasks、scenes、hours
派生标注 pose/action 的传感、人工、模型估计或合成 provenance
本体扩增 target morphologies、每本体小时与 morphology-hours
robot grounding robot trajectories、real/sim 比、batch sampling ratio
可执行性 IK、collision、contact、force、latency 与真机 outcome
版本与权利 source UID、manifest/hash、upstream license、撤回传播
证据等级 作者结果、作者联盟复跑、外部采用、独立负结果、同协议复现

VITRA 的 1.22M episodes 是上游视频派生 metadata;Ego2Robot 的 18,561h 是约 1,942h 输入在 15 种本体上的 synthetic morphology-hours;EgoVerse 的 living explorer 已超过论文快照;EgoLive 虽有 1,680h,却没有 robot action 或 policy。若不保留这些变换,规模榜会把数据复用、本体复制和原始经验混为一谈。

公开 artifact 也要分层:VITRA 有代码、模型和 metadata,但原论文 evaluation release 不完整;EgoVerse 代码 MIT,却未定位到 dataset license 或不可变 snapshot;EgoLive 的论文许可不能代替数据许可;EgoScale、Ego2Robot 与 EgoEngine 尚无完整官方训练 artifact;EgoHumanoid 有代码但只公开 sample data。没有任何一条路线已获得无作者重叠的同协议端到端复现。

证据:原始资料快照(本地归档)