具身智能系统工程
具身智能系统工程
具身智能系统工程指把机器人硬件边界、数据流、模型迭代、端侧实时控制、评测闭环和量产质量管理作为一个系统共同设计。它反对把具身智能简化为单一模型路线或单点 demo。
观察
- 实时和闭环是物理 AI 与纯软件大模型的核心差别。机器人动作改变环境,环境变化又影响下一步动作;传感器精度、执行器时延、线束、散热和功耗都会被系统放大。
- 端侧频率约束会反过来限制模型大小和架构选择。来源中黄青虬给出的口径是“大脑至少 10Hz、小脑至少 100Hz”,这说明物理法则会进入模型设计。
- 世界模型和 VLA 并非必然对立。它们可以分别提供空间、逻辑、几何或语义上的稠密反馈,帮助从高维感知 token 到低维动作 token 的压缩和模态对齐。
- 知跃空间智能 与 凌川科技 的合作显示,系统工程还包括芯片和模型的共同设计:端侧功耗、成本、可靠性和算法适配会决定 Physical AI 能否从云端 demo 进入真实设备。
- 源策未来 和 全身智能 提醒,系统工程还包括身体尺度:全身重心、躯干借力、多肢体协同、触觉和跨本体迁移不是单臂策略微调能解决的。
- 星海图 把系统工程推进到公司组织层:如果本体、模型、真实数据和场景部署不能形成闭环,VLA、世界模型、强化学习和硬件供应链就会彼此脱节。
- 智平方科技 的类脑架构叙事把系统工程推进到控制分层:语义规划、高频协调和安全反射如果不在不同时间尺度上协同,单一大模型很难稳定进入真实机器人动作链路。
- LiberAI 从训练侧补充系统工程问题:预训练、物理数据稀缺、视频/物理模态对齐和机器人可执行动作必须被一起设计,单纯扩大视频数据不一定提升物理泛化。
- 人形机器人基础模型 从评测和部署侧补充系统工程问题:人类视频预训练、机器人轨迹后训练、目标任务适配和物理世界预测需要形成连续链路。
- 人形机器人实景实训专项行动 把系统工程变成政策动作:真实场景、用户单位、整机企业、模型算法、零部件、数据治理、安全规范和金融/保险保障被放进同一个部署闭环。
- 星尘智能 把系统工程推进到本体设计:绳驱传动、具身 OS、快慢协同框架和真机数据对齐共同构成机器人能力,而不是由单一 VLA 模型决定。
- 灵初智能 把系统工程推进到数据和模型分工:成功动作策略、失败反事实、仿真评估、灵巧手和数据采集引擎需要协同,而不是只训练一个通用策略模型。
- 深圳 AI 硬件生态 从真实用户场景暴露系统工程缺口:家庭服务机器人会同时遇到延迟、夹取、任务规划、异常恢复、隐私和工程师陪跑成本。
- 人形机器人供应链 把系统工程推进到外部依赖:执行器、谐波减速器、滚柱丝杠、永磁体、力/触觉传感器和控制单元如果无法稳定供给,模型和本体设计都会被交付周期、成本和认证要求反向约束。
- 欧拉万象 把系统工程推进到家庭真实反馈闭环:创客产品、双臂底盘、本地数据采集、质检标注、模型训练、评测和用户反馈必须共同工作,才可能从“不完美但可学习”走向家庭可用。
- 量产能力不是制造后端问题,而是算法、数据、硬件、供应链和质量体系能否长期稳定运行的总和。
人机数据转换也是系统工程
- 人类活动数据 进入控制策略需要相机标定、3D/SLAM 重建、动作表示、机器人运动学过滤、控制延迟、目标本体数据和部署纠错共同工作。
- Universal Manipulation Interface 的 relative trajectory 和 latency matching、EgoMimic 的相机坐标 pose 与机器人 joint grounding 都说明:数据格式不能脱离传感器、硬件和执行器约束单独评价。
- DROID 的整库共同训练外部反例表明,多场景规模不会自动转成目标任务收益;对象、技能、相机和空间对齐是系统的一部分。
- LeRobot HIL 进一步把评测推进到控制权切换:自主成功、人工辅助完成、介入次数/时长和失败恢复必须分开统计,才能判断闭环是否真的改善。
相关页面
- 墨奇智能
- 黄青虬
- 具身智能数据基础设施
- 世界模型
- 物理 AI 创业生态
- 知跃空间智能
- 凌川科技
- 中试平台
- 源策未来
- 李弘扬
- 全身智能
- 星海图
- 智平方科技
- LiberAI
- 人形机器人基础模型
- 人形机器人实景实训专项行动
- 星尘智能
- 灵初智能
- 深圳 AI 硬件生态
- 人形机器人供应链
- 欧拉万象
证据
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)
- 星海图
- 智平方科技
- LiberAI
- 人形机器人基础模型
- 人形机器人实景实训专项行动
- 星尘智能
- 灵初智能
- 深圳 AI 硬件生态
- 人形机器人供应链
- 欧拉万象
2026-08-10 人类示范与部署纠错的系统接口
人类活动数据 的可用性取决于完整接口而非单一模型。EgoMimic 通过相似相机位置、分别归一化的人/机器人 pose 和共享策略网络连接两域;UMI 通过手持夹爪、相对轨迹、时延匹配和运动学检查减少部署错位;HIL-SERL 在真机循环中记录自动执行、接管、恢复和奖励。
系统验收因此应覆盖传感器同步、动作坐标、控制频率、SLAM/追踪失败、机器人可达性、力/触觉缺失、人工接管策略、训练/测试场景留出和安全事件。RoHIL 的跨光照结果说明,训练工作台成功率不能替代部署分布稳健性。
证据:原始资料快照(本地归档)
2026-08-10 补强:部署干预的数据状态机
部署纠错应被实现为显式的控制权状态机,而不是模糊的“人类反馈”:
- autonomous:策略控制机器人,并记录策略版本、观察、动作和安全状态;
- pause/takeover:触发阈值与操作者接管,暂停期间是否记录帧必须显式声明;
- recovery:先把机器人带回安全、可继续的状态;
- correction:在人类控制下示范正确动作;
- handoff:重新同步观察与控制权,再交还策略;
- retrain/evaluate:按 autonomous 与 intervention 分层采样、训练和评测。
每段轨迹应保存 control_authority、intervention、recovery/correction 边界、策略 checkpoint、机器人本体、时延、reset、安全停止、成功/失败和未记录区间。LeRobot v0.6.0 默认 record_autonomous=false 是一个实际反例:若只看到 HIL 标签却不知道配置,就可能误以为数据包含完整策略 rollout。这个工程链与人类活动数据、具身智能数据基础设施的来源分类必须一致。
人类数据路线的工程门槛(2026-08-10)
人类活动进入机器人策略不是单一模型问题,而是五个接口同时成立:观察视角与相机标定可比较;人体 pose 或手持接口能映射为机器人可执行动作;观测、推理和执行时延对齐;目标本体满足工作空间、关节极限与接触约束;真机部署能记录失败、恢复、安全事件和人工接管。EgoMimic、UMI 与 HIL-SERL 分别暴露了联合监督、SLAM/延迟和在线安全的系统瓶颈。只扩大第一视角视频,不能替代这些工程环节。
2026-08-10 数据 schema 与动作语义的系统边界
机器人数据管线至少要分别版本化:数据 corpus、仓库 revision、schema、转换脚本、训练 mixture 和策略 checkpoint。LeRobotDataset v3 能统一 Parquet/MP4 与 episode/task metadata,Open X-Embodiment 能用 RLDS 聚合异构数据,但格式兼容不等于动作语义兼容。
跨数据训练前应显式记录坐标系、absolute/delta/velocity action、末端执行器、控制频率、时间同步、相机标定、语言标注、失败筛选和 normalization statistics。DROID 数据集 的 36k 改进标定子集与 AgiBot World 的固定 LeRobot v2.1 commit 都说明 provenance 是模型行为的一部分;只写“LeRobot-compatible”不足以复现实验或判断许可。
DROID 镜像进一步显示,schema 字段也会改变表面统计:LeRobot 的 49,630 tasks 是主语言指令字典基数,而非 86 个语义任务类;上传器默认写入的 Apache-2.0 card metadata 也不能覆盖上游 CC BY 4.0。可复现管线应把字段生成规则与 data-license provenance 都作为构建产物保存。
证据:原始资料快照(本地归档)、原始资料快照(本地归档)
合成轨迹流水线的系统状态机(2026-08-10)
离线合成轨迹应实现为可审计状态机,而不是一次性生成任务:
- real calibration:固定目标本体真实数据、相机、动作坐标、统计量和许可证。
- candidate video:记录世界模型、checkpoint、seed、初始帧、指令、候选数与算力。
- visual pass/fail:保留评分器版本、prompt、阈值、人工复核和淘汰原因。
- pseudo action:记录 IDM/LAPA provenance、动作尺度、失败与缺失状态。
- replay pass/fail:以关节极限、碰撞、接触、运动一致性和任务结果验证可执行性。
- policy mixture:固定真实/合成 batch 采样比、策略 checkpoint 与 normalization。
- sim/real eval:分开报告仿真、真机、严格成功、partial progress、安全停止和失败样本。
DreamGen 实现 video→IDM/LAPA→policy 的离线链;GR00T-Dreams 把它迁移到 Cosmos blueprint;RLDX-1 进一步加入 VLM 与模拟回放/运动一致性过滤。三者不能因链条相似就共享模型版本、效果量或许可证。
LeRobot v0.6 的 world-action、reward 和 rollout 组件也没有自动形成上述闭环:训练期 world loss、推理期显式未来、reward-only 打分和真实 rollout 采集必须追踪真实调用方。DW0.5 当前 action expert 直接预测动作,Value Expert 未公开,不能写成已完成的世界模型→价值→策略后训练状态机。
系统验收除平均成功率外,还应加入 action shuffle/OOD action、失败保持、长程漂移、接触扰动、不同 seed 和同任务真机相关性;视觉真实或 VLM 分数不能替代这些检查。
证据:原始资料快照(本地归档)、LeRobot v0.6、dWorldEval。
奖励模型闭环的运行时验收(2026-08-10)
奖励模型的系统验收不能停在 checkpoint 可加载或离线相关性。至少要逐层回答:谁调用模型、输入是累计 prefix 还是局部帧窗、分数写到哪里、是否进入 loss/backward、是否进入环境 transition、是否改变 done/恢复/下一动作,以及失败时是否仍给出高奖励。
LeRobot v0.6 的固定源码把边界照得很清楚:Robometer/TOPReward 已形成“离线视频评分→progress parquet→RA-BC 加权 loss→backward”,但没有进入通用在线 RL;HIL-SERL 的 classifier 则形成另一条“env.step→predict_reward→transition→SAC learner”专用链。统一注册表不等于统一运行时。
外部压力测试还说明聚合指标不能代替故障工况:Robometer 在 ReTVL 上 global VOC 为 .994,但 Pre>Retry 仅 .086,并保留 .896 的严格有害片段;Large Reward Models 的 ManiSkill3 实验中,PI0.5 SFT 56.88 加 Robometer 后为 56.56。部署前应分别测停滞、retry、失败撤回、近成功状态、跨任务尺度、prompt、frame window 与查询 cadence。完整证据见 机器人奖励模型 和 原始资料快照(本地归档)。