具身智能数据基础设施
具身智能数据基础设施
具身智能的核心竞争正在从“有没有模型/本体”转向“能否持续获得真实世界数据”。这里的数据不只是视频规模,而包括带有明确标签来源的任务/意图数据、力触觉、肌电/脑电、第一视角闭环、真实用户反馈、标准化格式、处理溯源、伦理授权和产业采集能力。
当前判断
- 脑电进入机器人训练 把 Encord/Zander 的试运行放在物理 AI 数据供给不足的背景下;更早的 ICRA 2020 导航实验和 2025 年 7-DoF manipulation 预印本已经提供 EEG 错误相关反馈改善受控机器人强化学习的公开证据,但不证明 Encord/Zander 管线、通用 VLA 预训练或真实长期部署已有增益。
- OriginFlow 把神经肌电信号做成“采集硬件 + 多模态同步 + 数据处理”的产品栈:Origin Kit 同步 sEMG、IMU 和第一视角视频,Origin Data 负责质检、对齐、标注和交付。公开专利申请补充了运动伪迹和干电极稳定性问题,但性能与规模仍缺独立验证。
- EEG ImageNet 困境 提醒:生理信号数据不是只要规模够大就能复刻 ImageNet;标签真值、设备异构、预处理、伦理和共享激励同样决定数据可用性。
- 以人为中心的具身模型范式 把数据问题推进到家庭/共处场景:如果目标是长期与人互动,真实用户反馈、信任和人类行为理解本身就是训练闭环的一部分。
- 清创荟世界模型论坛 显示“世界模型、数据引擎、仿真验证、机器人具身应用”正在被组织成技术和资本交流议题。
- Mile Robotics 补充了 simulation-first 路线:把真实部署环境转成游戏化仿真,通过人类决策和极端场景生成机器人训练/验证数据。
- 机器人触觉感知 和 模感科技 补充了触觉路线:机器人需要通过接触、摩擦、滑移和受力变化获得纯视觉缺失的物理交互状态。
- 物理 AI 创业生态 显示,围绕物理 AI 的创业公司已经分化出真实动作数据、接触交互数据、世界模型、末端执行器、运动控制、行业 Agent 和 AI 安全等多条基础设施路线。
- 吴贤铭智能工程学院 提醒:数据和硬件之外,机器人/智能制造的人才培养和科研平台也是具身智能基础设施的一部分。
- World Labs 把持久 3D 世界、空间智能和仿真环境放进机器人训练与物理世界 AI 的基础设施叙事中,提示具身智能的数据层也可能来自可控生成世界和 real-to-sim-to-real 流程。
- 类脑具身智能 把数据基础设施推进到端侧在线学习:机器人需要在真实环境中记录本体状态、动作结果和反馈信号,并在安全边界内持续适应。
- 清华具身智能创业生态 显示,整机、本体、大脑、垂直场景和供应链正在形成不同创业生态位;基础设施不只是数据,也包括人才、资本、产业链和场景入口。
- Worldscape-MoE 提出把 locomotion、manipulation 和 hand motion 等异源控制信号接入同一个世界模型,说明具身数据基础设施的难点包括控制接口之间的兼容和扩展。
- GOAI 世界人工智能开源大赛 表明开源具身智能模型、数据、仿真、工具链和 runnable demo 正在被赛事/基金会机制组织起来。
- DW0.5 把 learned environment 纳入数据基础设施:少量真机 rollout 校准世界模型,世界模型再承担低成本候选动作探索、失败模拟和后训练反馈。
- 墨奇智能 和 具身智能系统工程 强调数据质量与系统闭环:具身数据的终局不是“囤更多视频”,而是真实作业人员、真实场景、真实工作流中的高质量、时间同步、多模态数据。
- 知跃空间智能 与 凌川科技 的合作把基础设施问题推到端侧:Physical AI 的数据闭环要能落在低功耗芯片、本地推理、实时控制和机器人真实部署环境中。
- 脸谱心智 和 Ego-NeuroLoop 把数据层推进到人类闭环:gaze、EEG、sEMG 与第一视角视觉同步后,可为目标、任务阶段、发力和误差修正提供候选代理信号;同步本身并不等于记录到潜在意图,更不能自动识别因果链。
- 源策未来 和 全身智能 把数据缺口推进到全身协同:重心变化、躯干借力、多肢体联动和真实居家任务可能比单臂桌面数据更接近人形机器人终局。
- MindSpace 从空间侧补充了另一种基础设施想象:空间样本、传感信号和心理响应可以被组织为空间记忆层或空间数据库。
- 星海图 把真实机器人数据进一步推到产业组织层:百万小时计划、数据联盟、采集成本、清洗回流和模型耦合说明数据基础设施不是简单“多采视频”,而是一套长期运营系统。
- LiberAI 把物理数据稀缺和模态不均衡作为预训练瓶颈,说明具身数据基础设施还包括如何在视频空间和物理空间之间建立桥梁,而不是简单混合所有数据。
- EEG 数据注册库 从脑电侧补充了“注册库”路线:当数据分散在不同平台和文献中时,结构化元数据入口本身就是基础设施。
- PSI Lab 与 人形机器人基础模型 把数据基础设施推进到开放世界人形操作:真实轨迹、多模态传感、云端评测和可复现任务设置共同决定模型是否可比较。
- ABot-Earth 从空间生成侧补充了环境数据层:城市级 3D 空间如果能低成本生成和导入引擎,就可能成为低空、自动驾驶、应急和机器人导航的仿真/验证底座。
- 人形机器人实景实训专项行动 把数据基础设施推进到政策组织层:真实场景单元、创新应用联合体、全身运动轨迹、力位控制曲线、异常工况和部署验证都被纳入数据沉淀对象。
- 世界模型技术路线 提醒,数据基础设施要服务不同路线:RSSM 需要交互轨迹,视频/扩散路线需要视觉序列,JEPA 需要语义表征,embodied route 需要人类视频和机器人轨迹对齐。
- 人体模型 把数据基础设施推进到人的身体侧:身体状态、动作质量、训练反馈、疲劳和个体长期变化都可能成为人本 AI 的训练和评估数据。
- 手亿科技 把手眼 POV 数据采集做成可穿戴硬件路线,说明高质量操作数据可以围绕人类手部动作、IMU、视觉和指令同步来规模化。
- 星尘智能 则从本体侧补充数据基础设施问题:绳驱机器人、具身 OS、快慢系统和真机对齐共同决定真实数据能否回流到模型和产品。
- 消费级空间相机 从环境侧补充数据入口:3DGS 相机采集的是家庭、室内和小尺度真实空间的几何/视觉资产,可为仿真、设计和空间记忆提供底层素材。
- 灵初智能 从人类操作侧补充数据入口:穿戴式采集手套、触觉、关节角、腕部位姿和视觉同步,使“人类如何完成精细操作”成为可训练数据。
- 人类活动数据 把数据入口进一步一般化:机器人学习可能需要的是人类自然活动中的第一视角、身体轨迹、任务上下文和触觉线索,而不只是机器人遥操作日志。
- 欧拉万象 把数据基础设施推进到家庭产品闭环:先让一部分机器人进入高容错用户场景,用真实失败、用户纠正、任务边界和部署反馈校准数据管线与模型迭代。
- MindSpace 的 Human Model 草案提出同步采集第一视角视觉、脑电/肌电/心电等神经生理信号和行动选择。它是产品/研究框架,不是公认学术代际;能否把三轨数据转成跨人的稳健预测仍需验证,不能从“同步”直接推出意图读取或“感知→神经表征→意图→行动”的因果识别。
- EgoBrain 提供了可校准这一设想的公开基线:61 小时、40 名参与者、29 类受控日常动作,以第一视角视频和 32 通道 EEG 做动作分类;官方数据页另含 IMU。
- EgoBrain 的公开模态没有 EMG 或 ECG;其融合结果回答的是动作分类问题,不是潜在意图读取、神经中介机制识别或真实机器人闭环。
- Conduit 从神经—语言对齐侧补充了规模化采集运营:团队第一方称六个月采集约一万小时、覆盖数千名参与者,并把多种非侵入式神经数据与文本/音频对齐后统一存入 Zarr 3。
- 这个公司案例说明传感器组合、参与者招募、在线质检和统一格式本身就是基础设施;但数据、模型和 zero-shot 结果未完整公开,也没有证明对机器人任务有增益。
人类活动到机器人策略的闭环证据
- Ego4D 是自然第一视角观察层:规模化记录人类活动,但没有机器人 action、proprioception、force 或 reward。
- Ego-Exo4D 是结构化 ego/exo 技能层:同步多视角、3D 手/身体和步骤标注增加几何监督,仍不是机器人控制轨迹。
- EgoMimic 是 human+robot 共训层:共享相机坐标 pose 语义,但原生机器人动作与 joint grounding 只来自机器人侧。
- Universal Manipulation Interface 是接口约束示范层:机器人化夹爪、relative trajectory 和 latency matching 让动作更接近 robot-compatible,仍受目标本体运动学与动力学约束。
- DROID 数据集 是真机遥操作层:约 16,000 条 unsuccessful trajectories 仍是人全程控制下的 episode 级结果,不是策略 rollout 中的人工介入。
- HIL-SERL 与 LeRobot v0.6 HIL 是部署局部接管层:只有保留自主段、控制权、策略原动作、接管原因、恢复/纠正阶段和 outcome,才足以研究策略自己的失败分布。
- 六级链路互补。小时、takes、demonstrations、trajectories 和 intervention windows 不能折成单一数据规模排名。
详见 人类活动数据 与 原始资料快照(本地归档)。
UMI 后续的多模态数据会计(2026-08-10)
UMI、FastUMI、UMI-3D、DexUMI 与 TacUMI(多模态事件分割)说明,采集硬件、标签生成和策略观测必须分三层建账:
| 系统 | 规模口径 | 采集/标签层 | 策略观测层 | 必须保留的缺口 |
|---|---|---|---|---|
| FastUMI | arXiv 10k/22;PMLR 15k/24;公开 artifact 仍为22任务旧快照 | GoPro+T265,ROS 时间与近邻 pose 匹配 | RGB;深度版实际加入估计深度 | 论文版本、artifact revision、过滤保留率与动作 schema |
| FastUMI-100K | 论文总体100k+/54/600h;当前公开34,052条双臂 episode、12任务、约178.6轨迹小时 | 单/双套 GoPro+T265,20Hz relative EEF action | 腕部 RGB+相对末端动作 | 单臂/剩余任务 manifest、生成代码、对象规格与机器可读许可 |
| UMI-3D | 4609 demos,单臂平行夹爪 | LiDAR+IMU+硬件触发相机生成公制 SE(3) 标签 | 当前只有 RGB+proprio | 不能把采集端3D写成点云策略;需 ground-truth SLAM 与跨本体对照 |
| DexUMI | 公开登记1792 demos、每包单环境 | 目标手专用外骨骼、ARKit、RGB和触觉;真实机器人手 replay 后做视觉转换 | 处理后 RGB+可选触觉 | 每种手的映射、同步延迟、触觉漂移、转换依赖许可和原始到策略的 provenance |
| TacUMI(Cheng 等) | 单任务约30k frames,未报轨迹/小时/操作者 | 非对称双手 F/T、触觉、Vive 与固定 RGB-D | 无操控策略;离线分割器消费多模态输入 | 代码、数据、标签、划分、checkpoint与许可均未公开 |
基础设施至少应分别保存 collection_sensor、label_source、training_observation、deployment_observation、action_frame、clock_and_alignment、robot_hand_or_gripper、dataset_revision、license_scope 与 evaluation_provenance。否则“有3D”“有触觉”“跨本体”和“100K”会把完全不同的事实折叠成营销标签。
作者跨平台结果、第三方组件复建和同协议独立复现也不能合并。FastUMI 只有 replay utility 与社区故障信号;UMI-3D 没有第三方完整复建;DexEXO 独立显示 DexUMI 外骨骼在剪刀任务上0成功率,但没有复现其视觉转换与策略全链;TacUMI 仍停在官方 artifact 不足以执行复算。
证据:原始资料快照(本地归档)
可复用框架
目前可以按数据角色分层;以下类别可以并列,并非互斥:
- 动作结果数据:普通视频、第三视角视频、遥操作记录。
- 执行过程数据:第一视角视频、手眼动作闭环、多传感器记录、力触觉。
- 人体状态数据:脑电、肌电、神经肌肉信号,以及具有明确来源的任务、意图自述或错误标签;生理信号不能直接当作意图真值。
- 神经—语言对齐数据:非侵入式神经信号、参与者打字/语音、文本或音频目标、被试/session 标识、传感器配置、时间同步、同意范围与模型置信度;语义相似预测不能改写成逐字读心。
- 真实交互数据:长期用户反馈、家庭服务行为、人机信任与偏好变化。
- 仿真生成数据:沉浸式环境、游戏化任务、边缘场景和安全关键测试。
- 空间世界数据:可持久编辑的 3D 世界、几何/物理/时间结构、设计制造场景和 real-to-sim-to-real 训练环境。
- 在线适应数据:端侧本体状态、动作反馈、失败恢复、奖励信号和安全中断记录。
- 异源控制数据:相机轨迹、机械臂动作、手部 action map、移动底盘、灵巧手和力/触觉反馈。
- 人才与组织基础设施:高校学院、科研平台、产业对接活动、创业营和产品日。
- 闭环后训练环境:action-conditioned world model、value expert、偏好数据、RL reward、真实 rollout 校准。
- 量产系统数据:端侧实时控制日志、传感器时间同步、执行器误差、异常分支、质量追踪和真实部署反馈。
- 端侧算力与模型协同基础设施:低功耗 AI 芯片、边缘推理工具链、模型压缩/适配、真实传感器数据同步和部署监控。
- 人类闭环信号数据:world camera、gaze、EEG、sEMG、任务标签、意图自述、误差感知、肌肉激活和反馈修正轨迹,并保留同步误差、标签来源与推断不确定性。
- 全身协同数据:重心迁移、躯干姿态、双手协作、腿部支撑、触觉反馈和复杂居家任务中的全身运动轨迹。
- 空间心理响应数据:空间样本、传感信号、人的心理/注意/情绪响应和可检索空间记忆。
- 真机数据联盟:多企业共建的真实机器人数据、质量控制、采集设备、运营流程和模型回流机制。
- 数据注册库与元数据入口:跨论文、跨平台、跨任务的数据发现、许可证、设备、标签和任务元数据。
- 开放世界人形操作数据:移动操作、双臂协同、触觉/RGB/depth/LiDAR、自然语言标注和统一云端评测。
- 城市级空间生成数据:遥感/地图/3DGS 生成的可漫游、可编辑城市空间,用于数字孪生、低空和机器人环境验证。
- 实景实训数据:真实场景单元中的作业流程、全身轨迹、力位控制、异常处置、安全事件和部署成效指标。
- 人体动态模型数据:姿态、平衡、力量、疲劳、意图、动作质量和长期训练反馈。
- 手眼操作采集数据:腕部视角、头戴视角、IMU、手部姿态、操作指令和时间同步。
- 本体-模型协同数据:机器人本体结构、传动方案、真机反馈、快慢系统日志和模型对齐轨迹。
- 消费级空间采集数据:室内几何、材质外观、空间尺度、视角路径和可回放空间记忆。
- 人类精细操作数据:手部关节、触觉、腕部位姿、视觉输入、成功/失败轨迹和任务语义。
- 人类自然活动数据:第一视角视频、身体运动、日常任务、环境交互、注意线索和不经意长尾行为。
- 家庭部署反馈数据:创客/开发者使用记录、家庭任务失败分支、用户纠正、环境约束、模型更新效果和长期可靠性变化。
真正的瓶颈可能不是单一类型数据不足,而是这些数据如何被同步、标注、标准化、合规共享并转化成可评测的模型改进。
截至 2026-08-10 的结论与结题证据
- 脑电对受控机器人策略学习已有任务级增益证据,但还不是通用基础设施结论。 ICRA 2020 在导航稀疏奖励任务中用 EEG error-related signal 引导探索;2025 年预印本把离线 EEG 解码用于 7-DoF manipulation 的 reward shaping。EgoBrain 仍只支持动作分类,Ego-NeuroLoop 与 OriginFlow 是同步采集/产品路线。下一层结题需要公开数据与标签来源、显式反馈与伪 EEG 对照、跨被试/设备/场景留出、真机成功率、失败和安全事件;作者实验不能外推为 VLA 预训练、工业规模或长期部署收益。
- OriginFlow/NeuroScale 当前是可核验的产品与专利线索,不是性能结论。 已公开信息支持 sEMG、IMU、第一视角视频及数据处理栈;跨人泛化、机器人任务增益、付费部署规模和参与者权益仍没有独立证据。结题材料应同时包含独立 benchmark、客户侧部署口径、采集同意与撤回流程、技能数据二次使用/收益规则和硬件失效分析。
- 人本具身评测必须同时覆盖任务、关系和治理。 用户纠正、接受/拒绝、人工接管、主动服务撤回、失败恢复和授权变化可以形成事件级训练信号,但不能把留存率或满意度单独当奖励。可靠评测应在长期部署中同时报告任务成功、安全事件、打扰成本、校准/拒答、成员差异、隐私撤回和模型更新前后变化。
- EEG 数据注册库解决“找到什么”,不能独自解决“能否共享和复用”。 EEG 数据注册库 已证明结构化任务、设备、通道、参与者、许可证和托管入口能降低发现成本;EEG 数据共享困境 表明格式、标签真值、伦理授权和激励仍分离存在。结题需要机器可读许可证/同意范围、标准数据卡、处理溯源、访问审计、撤回传播、贡献者署名或收益机制,以及跨设备/任务 benchmark。
- 真机数据联盟已有政策对象,但没有统一公共标准。 人形机器人实景实训专项行动 已把全身轨迹、力位控制、操作序列、空间语义、异常工况、知识产权和利益分配纳入行动要求;“百个场景、万台级能力”仍是 2026 年底目标。联盟结题需要任务与本体 ontology、时间同步/传感器规范、抽样质检、失败与安全事件口径、许可证和收益分配,以及同任务跨本体迁移结果。
- 家庭反馈只有在成员级授权和最小化采集下才可复用。 数据记录应区分家庭管理员、实际使用者、儿童、老人和访客,按任务与模态单独授权;默认本地处理、最小留存,并提供暂停、导出、纠错、删除和授权过期。欧拉万象 的 maker/developer 路线说明真实失败与纠正可能形成迭代闭环,但当前没有公开的长期数据卡、成员授权审计或模型增益对照。
- Human Model 三轨数据必须分三级主张。 同步数据只能支持时间关联;被试/session/场景留出、模态消融、伪同步对照、校准与拒答可以支持增量预测;预注册意图标签、随机化动作/信息干预和中介分析才接近因果机制。当前证据最多覆盖动作分类与方向性产品草案,不能写成潜在意图读取或“感知—神经表征—意图—行动”因果链。
- 公司内部管线和 gated 发布不是公共基准的反面,但必须可审计。 EgoBrain 显示 gated access 可与数据卡、非商业许可和反识别条款并存;公司内部格式统一则只证明运营能力。公共基准的结题条件是可发现的版本、参与者与 session 切分、标签和预处理 provenance、许可/撤回传播、固定评测代码、独立复现,以及至少一个真实下游任务的增益和成本报告。
相关页面
- 脑电与具身智能
- EEG 数据共享困境
- 以人为中心的具身智能
- 世界模型
- 清华具身智能创业生态
- OriginFlow
- Mile Robotics
- 机器人触觉感知
- 模感科技
- 物理 AI 创业生态
- 吴贤铭智能工程学院
- World Labs
- 类脑具身智能
- 清华具身智能创业生态
- Worldscape-MoE
- 手亿科技
- 星尘智能
- GOAI 世界人工智能开源大赛
- DW0.5
- 墨奇智能
- 具身智能系统工程
- 知跃空间智能
- 凌川科技
- 脸谱心智
- Ego-NeuroLoop
- MindSpace
- 源策未来
- 全身智能
- 星海图
- LiberAI
- EEG 数据注册库
- PSI Lab
- 人形机器人基础模型
- ABot-Earth
- 人形机器人实景实训专项行动
- 世界模型技术路线
- 人体模型
- 消费级空间相机
- 灵初智能
- 人类活动数据
- Universal Manipulation Interface
- FastUMI
- UMI-3D
- DexUMI
- TacUMI(多模态事件分割)
- 欧拉万象
- Conduit
- EgoBrain
补充证据
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)
- ICRA 2020: Accelerated Robot Learning via Human Brain Signals
- EEG reward shaping for 7-DoF manipulation
- Mind Meets Robots review
- 原始资料快照(本地归档)
2026-08-10 人类活动到机器人训练的六级谱系
人类活动数据 按控制权与动作真值把链路拆成六级:自然第一视角观察、结构化 ego/exo 技能记录、human+robot 共同训练、接口约束人类示范、真机遥操作、策略部署局部接管。前两级没有机器人原生动作;中间两级制造动作代理并用目标机器人约束落地;后两级才直接记录机器人执行,其中只有部署局部接管覆盖当前策略实际访问的失败邻域。
六级不能按“小时数”直接排名。自然视频缺机器人动作,接口示范受运动学、时延、SLAM 与触觉限制,遥操作失败不等于策略失败,HIL 数据又受记录配置、策略访问状态和人工接管选择偏差影响。基础设施比较至少同时记录原始单位、控制权、动作表示、训练/测试本体、场景留出、失败轨迹、参与者同意、数据许可与撤回传播。
证据:原始资料快照(本地归档)、原始资料快照(本地归档)
2026-08-10 补强:控制权、状态分布与动作真值
机器人数据不能只按“人类数据/机器人数据”二分。更有解释力的主轴是:
| 数据来源 | 谁控制 | 状态分布 | 原生机器人动作 | 主要价值 |
|---|---|---|---|---|
| Ego4D | 人控制自己的身体 | 自然日常第一视角分布 | 无 | 覆盖、表征与任务先验 |
| Ego-Exo4D | 人控制自己的身体 | 预定义熟练活动的同步多视角分布 | 无 | 技能步骤、姿态与几何对应 |
| EgoMimic | 人和机器人分别示范 | 任务内人类 + 遥操作分布 | 只在机器人侧有 | 人机共享表示与少量 robot data 落地 |
| UMI、FastUMI | 人操作类机器人末端 | 接口约束的人类任务分布 | 相对 EEF 轨迹接近 robot-compatible | 低成本采集与动作对齐 |
| DROID 数据集 | 人全程遥操作机器人 | teleoperator 选择的机器人状态 | 有 | 大规模部署前示范 |
| LeRobot HIL、HIL-SERL | 策略自主与人局部接管 | 当前策略真正访问的状态 | 有 | 失败邻域、recovery 与 correction |
DROID 的失败轨迹是人工遥操作失败,不能写成 policy deployment failures。LeRobot HIL 也不必然保存完整 autonomous rollout:v0.6.0 默认只记录 correction windows。数据基础设施若不记录 control_authority、autonomous/intervention 分段、目标本体、动作表示、时延、失败与许可,就会把训练前示范、策略失败和人类反馈错误地合成一个“数据闭环”。
这也解释了规模与可执行性的权衡:自然视频便宜且覆盖广,但离 robot action 远;接口约束示范更可执行,却改变了人的自然动作;机器人遥操作和 HIL 最贴近部署,成本、安全和选择偏差也最高。EgoScale与Ego2Robot等 2026 路线试图用动作重定向、视觉合成和 embodiment adapters 改变这条成本曲线,目前仍以作者证据为主。
2026-08-10 开放机器人学习数据集与格式基线
| 基础设施范式 | 代表对象 | 主要解决什么 | 不能据此推出什么 |
|---|---|---|---|
| 跨机构异构联盟 | Open X-Embodiment | 让多实验室、多本体数据进入共同 RLDS/训练管线 | 动作坐标、质量、task ontology 与许可已经统一 |
| 同构硬件分布式采集 | DROID 数据集 | 用标准 Franka 套件扩大地点、场景和操作者分布 | 18 套采集系统等于 18 种本体;人工失败等于策略失败 |
| 格式与运行时 | LeRobotDataset | 用 Parquet、MP4、关系型 metadata 和 streaming 统一存取接口 | 它有一个可按总轨迹排名的 corpus;转换后许可变成 Apache-2.0 |
| 垂直整合人形语料 | AgiBot World | 在同构 G1/G2 平台连接采集、标注、模型与 benchmark | 100+ robot units 等于 100+ embodiments;2026 自动继承 2025 规模 |
比较这四条路线时必须分列 trajectories/episodes、hours、task instances/语义任务类、skills、scenes、robot units/setups/embodiments 和 TB。RLDS 或 LeRobot 统一的是存储包络,不会自动统一坐标系、absolute/delta/velocity action、控制频率、标定、失败筛选、任务语义和许可证。
证据层也应分开:作者模型结果、外部采用、独立同协议复现和独立负结果不是同一等级。DROID 子核验已经说明:LeRobot 镜像的 95,658 episodes 与官方 RLDS v1.0.1 一一对应,其中 78,864 成功、16,794 失败;49,630 是去重的主语言指令字符串(含空值),不是 86 个语义任务类。镜像 card 的 Apache-2.0 来自通用上传默认值,不能替代上游 CC BY 4.0。版本追踪进一步确认,76k 是 2024 年首发论文/项目页沿用的概数;RLDS 总量从 v1.0.0 的 92,233 变为 2025 年 v1.0.1 的 95,658,但上游未发布逐版成功/失败分拆、episode-ID diff 或增量原因。作者只明确说明 v1.0.1 补齐约 75k episode 的语言标注,不能据此把名义 2,864 差值写成已证实新增量。
证据:原始资料快照(本地归档)、原始资料快照(本地归档)、原始资料快照(本地归档)
合成轨迹的数据会计(2026-08-10)
合成数据基础设施不能只报最终视频或 episode 数量。DreamGen、GR00T-Dreams 与 RLDX-1 表明,至少要分别记录:
| 阶段 | 必要字段 | 为什么不能省略 |
|---|---|---|
| 真实校准数据 | 本体、任务、场景、轨迹数、小时、动作表示 | 决定 WFM、IDM 与策略对目标硬件知道什么 |
| 候选生成 | 模型/revision、初始帧、prompt、候选数、GPU-hours | 候选视频不是可执行轨迹 |
| 视频过滤 | 指令遵循、视觉合理性、阈值、淘汰数、人审/API 成本 | 只控制媒体质量与任务偏离 |
| 动作恢复 | IDM/LAPA 版本、训练 provenance、成功数 | 伪动作质量可独立于视频质量失败 |
| 可执行性过滤 | 模拟回放、运动一致性、关节/碰撞/接触约束、保留数 | 防止视觉连贯但动作不可执行 |
| 混合训练 | 原始计数比、batch 采样比、策略 checkpoint | 1:333 的库存不等于 1:333 的训练权重 |
| 下游评测 | 真实/仿真、任务/本体/场景、rollout 数、严格成功与 partial progress | 防止跨协议拼接效果量 |
DreamGen 240,000 条 RoboCasa 生成样本对应推导的 81,000 L40 GPU-hours,但候选到保留率未公开;RLDX-1 最终有 150,000 条过滤后合成 episode,也未公开候选数与逐级保留率。二者都按真实:合成=1:1 训练抽样的关键实验说明,合成库存规模不能代替 mixture 口径。
真实数据仍承担本体适配、IDM 监督、模拟回放参照、过滤器正例、策略微调和真机安全验证。当前证据支持受真实数据校准的扩增,不支持无真实数据替代。
证据:DreamGen、GR00T-Dreams、RLDX-1、原始资料快照(本地归档)。
人类视频转换链的数据会计(2026-08-10)
人类视频到机器人策略学习说明,人类视频数据基础设施至少要分别记录:
| 字段 | 必须分开的口径 |
|---|---|
| 原始经验 | unique source videos、people、tasks、scenes、hours |
| 派生标注 | pose/action 的传感、人工、模型估计或合成 provenance |
| 本体扩增 | target morphologies、每本体小时与 morphology-hours |
| robot grounding | robot trajectories、real/sim 比、batch sampling ratio |
| 可执行性 | IK、collision、contact、force、latency 与真机 outcome |
| 版本与权利 | source UID、manifest/hash、upstream license、撤回传播 |
| 证据等级 | 作者结果、作者联盟复跑、外部采用、独立负结果、同协议复现 |
VITRA 的 1.22M episodes 是上游视频派生 metadata;Ego2Robot 的 18,561h 是约 1,942h 输入在 15 种本体上的 synthetic morphology-hours;EgoVerse 的 living explorer 已超过论文快照;EgoLive 虽有 1,680h,却没有 robot action 或 policy。若不保留这些变换,规模榜会把数据复用、本体复制和原始经验混为一谈。
公开 artifact 也要分层:VITRA 有代码、模型和 metadata,但原论文 evaluation release 不完整;EgoVerse 代码 MIT,却未定位到 dataset license 或不可变 snapshot;EgoLive 的论文许可不能代替数据许可;EgoScale、Ego2Robot 与 EgoEngine 尚无完整官方训练 artifact;EgoHumanoid 有代码但只公开 sample data。没有任何一条路线已获得无作者重叠的同协议端到端复现。
证据:原始资料快照(本地归档)