具身智能系统工程

具身智能系统工程

具身智能系统工程指把机器人硬件边界、数据流、模型迭代、端侧实时控制、评测闭环和量产质量管理作为一个系统共同设计。它反对把具身智能简化为单一模型路线或单点 demo。

观察

人机数据转换也是系统工程

相关页面

证据

2026-08-10 人类示范与部署纠错的系统接口

人类活动数据 的可用性取决于完整接口而非单一模型。EgoMimic 通过相似相机位置、分别归一化的人/机器人 pose 和共享策略网络连接两域;UMI 通过手持夹爪、相对轨迹、时延匹配和运动学检查减少部署错位;HIL-SERL 在真机循环中记录自动执行、接管、恢复和奖励。

系统验收因此应覆盖传感器同步、动作坐标、控制频率、SLAM/追踪失败、机器人可达性、力/触觉缺失、人工接管策略、训练/测试场景留出和安全事件。RoHIL 的跨光照结果说明,训练工作台成功率不能替代部署分布稳健性。

证据:原始资料快照(本地归档)

2026-08-10 补强:部署干预的数据状态机

部署纠错应被实现为显式的控制权状态机,而不是模糊的“人类反馈”:

  1. autonomous:策略控制机器人,并记录策略版本、观察、动作和安全状态;
  2. pause/takeover:触发阈值与操作者接管,暂停期间是否记录帧必须显式声明;
  3. recovery:先把机器人带回安全、可继续的状态;
  4. correction:在人类控制下示范正确动作;
  5. handoff:重新同步观察与控制权,再交还策略;
  6. retrain/evaluate:按 autonomous 与 intervention 分层采样、训练和评测。

每段轨迹应保存 control_authorityintervention、recovery/correction 边界、策略 checkpoint、机器人本体、时延、reset、安全停止、成功/失败和未记录区间。LeRobot v0.6.0 默认 record_autonomous=false 是一个实际反例:若只看到 HIL 标签却不知道配置,就可能误以为数据包含完整策略 rollout。这个工程链与人类活动数据具身智能数据基础设施的来源分类必须一致。

人类数据路线的工程门槛(2026-08-10)

人类活动进入机器人策略不是单一模型问题,而是五个接口同时成立:观察视角与相机标定可比较;人体 pose 或手持接口能映射为机器人可执行动作;观测、推理和执行时延对齐;目标本体满足工作空间、关节极限与接触约束;真机部署能记录失败、恢复、安全事件和人工接管。EgoMimicUMIHIL-SERL 分别暴露了联合监督、SLAM/延迟和在线安全的系统瓶颈。只扩大第一视角视频,不能替代这些工程环节。

2026-08-10 数据 schema 与动作语义的系统边界

机器人数据管线至少要分别版本化:数据 corpus、仓库 revision、schema、转换脚本、训练 mixture 和策略 checkpoint。LeRobotDataset v3 能统一 Parquet/MP4 与 episode/task metadata,Open X-Embodiment 能用 RLDS 聚合异构数据,但格式兼容不等于动作语义兼容。

跨数据训练前应显式记录坐标系、absolute/delta/velocity action、末端执行器、控制频率、时间同步、相机标定、语言标注、失败筛选和 normalization statistics。DROID 数据集 的 36k 改进标定子集与 AgiBot World 的固定 LeRobot v2.1 commit 都说明 provenance 是模型行为的一部分;只写“LeRobot-compatible”不足以复现实验或判断许可。

DROID 镜像进一步显示,schema 字段也会改变表面统计:LeRobot 的 49,630 tasks 是主语言指令字典基数,而非 86 个语义任务类;上传器默认写入的 Apache-2.0 card metadata 也不能覆盖上游 CC BY 4.0。可复现管线应把字段生成规则与 data-license provenance 都作为构建产物保存。

证据:原始资料快照(本地归档)、原始资料快照(本地归档)

合成轨迹流水线的系统状态机(2026-08-10)

离线合成轨迹应实现为可审计状态机,而不是一次性生成任务:

  1. real calibration:固定目标本体真实数据、相机、动作坐标、统计量和许可证。
  2. candidate video:记录世界模型、checkpoint、seed、初始帧、指令、候选数与算力。
  3. visual pass/fail:保留评分器版本、prompt、阈值、人工复核和淘汰原因。
  4. pseudo action:记录 IDM/LAPA provenance、动作尺度、失败与缺失状态。
  5. replay pass/fail:以关节极限、碰撞、接触、运动一致性和任务结果验证可执行性。
  6. policy mixture:固定真实/合成 batch 采样比、策略 checkpoint 与 normalization。
  7. sim/real eval:分开报告仿真、真机、严格成功、partial progress、安全停止和失败样本。

DreamGen 实现 video→IDM/LAPA→policy 的离线链;GR00T-Dreams 把它迁移到 Cosmos blueprint;RLDX-1 进一步加入 VLM 与模拟回放/运动一致性过滤。三者不能因链条相似就共享模型版本、效果量或许可证。

LeRobot v0.6 的 world-action、reward 和 rollout 组件也没有自动形成上述闭环:训练期 world loss、推理期显式未来、reward-only 打分和真实 rollout 采集必须追踪真实调用方。DW0.5 当前 action expert 直接预测动作,Value Expert 未公开,不能写成已完成的世界模型→价值→策略后训练状态机。

系统验收除平均成功率外,还应加入 action shuffle/OOD action、失败保持、长程漂移、接触扰动、不同 seed 和同任务真机相关性;视觉真实或 VLM 分数不能替代这些检查。

证据:原始资料快照(本地归档)、LeRobot v0.6dWorldEval

奖励模型闭环的运行时验收(2026-08-10)

奖励模型的系统验收不能停在 checkpoint 可加载或离线相关性。至少要逐层回答:谁调用模型、输入是累计 prefix 还是局部帧窗、分数写到哪里、是否进入 loss/backward、是否进入环境 transition、是否改变 done/恢复/下一动作,以及失败时是否仍给出高奖励。

LeRobot v0.6 的固定源码把边界照得很清楚:Robometer/TOPReward 已形成“离线视频评分→progress parquet→RA-BC 加权 loss→backward”,但没有进入通用在线 RL;HIL-SERL 的 classifier 则形成另一条“env.step→predict_reward→transition→SAC learner”专用链。统一注册表不等于统一运行时。

外部压力测试还说明聚合指标不能代替故障工况:Robometer 在 ReTVL 上 global VOC 为 .994,但 Pre>Retry 仅 .086,并保留 .896 的严格有害片段;Large Reward Models 的 ManiSkill3 实验中,PI0.5 SFT 56.88 加 Robometer 后为 56.56。部署前应分别测停滞、retry、失败撤回、近成功状态、跨任务尺度、prompt、frame window 与查询 cadence。完整证据见 机器人奖励模型 和 原始资料快照(本地归档)。