具身智能系统工程
具身智能系统工程
具身智能系统工程指把机器人硬件边界、数据流、模型迭代、端侧实时控制、评测闭环和量产质量管理作为一个系统共同设计。它反对把具身智能简化为单一模型路线或单点 demo。
观察
- 实时和闭环是物理 AI 与纯软件大模型的核心差别。机器人动作改变环境,环境变化又影响下一步动作;传感器精度、执行器时延、线束、散热和功耗都会被系统放大。
- 端侧频率约束会反过来限制模型大小和架构选择。来源中黄青虬给出的口径是“大脑至少 10Hz、小脑至少 100Hz”,这说明物理法则会进入模型设计。
- 世界模型和 VLA 并非必然对立。它们可以分别提供空间、逻辑、几何或语义上的稠密反馈,帮助从高维感知 token 到低维动作 token 的压缩和模态对齐。
- 知跃空间智能 与 凌川科技 的合作显示,系统工程还包括芯片和模型的共同设计:端侧功耗、成本、可靠性和算法适配会决定 Physical AI 能否从云端 demo 进入真实设备。
- 源策未来 和 全身智能 提醒,系统工程还包括身体尺度:全身重心、躯干借力、多肢体协同、触觉和跨本体迁移不是单臂策略微调能解决的。
- 星海图 把系统工程推进到公司组织层:如果本体、模型、真实数据和场景部署不能形成闭环,VLA、世界模型、强化学习和硬件供应链就会彼此脱节。
- 智平方科技 的类脑架构叙事把系统工程推进到控制分层:语义规划、高频协调和安全反射如果不在不同时间尺度上协同,单一大模型很难稳定进入真实机器人动作链路。
- LiberAI 从训练侧补充系统工程问题:预训练、物理数据稀缺、视频/物理模态对齐和机器人可执行动作必须被一起设计,单纯扩大视频数据不一定提升物理泛化。
- 人形机器人基础模型 从评测和部署侧补充系统工程问题:人类视频预训练、机器人轨迹后训练、目标任务适配和物理世界预测需要形成连续链路。
- 人形机器人实景实训专项行动 把系统工程变成政策动作:真实场景、用户单位、整机企业、模型算法、零部件、数据治理、安全规范和金融/保险保障被放进同一个部署闭环。
- 星尘智能 把系统工程推进到本体设计:绳驱传动、具身 OS、快慢协同框架和真机数据对齐共同构成机器人能力,而不是由单一 VLA 模型决定。
- 灵初智能 把系统工程推进到数据和模型分工:成功动作策略、失败反事实、仿真评估、灵巧手和数据采集引擎需要协同,而不是只训练一个通用策略模型。
- 深圳 AI 硬件生态 从真实用户场景暴露系统工程缺口:家庭服务机器人会同时遇到延迟、夹取、任务规划、异常恢复、隐私和工程师陪跑成本。
- 人形机器人供应链 把系统工程推进到外部依赖:执行器、谐波减速器、滚柱丝杠、永磁体、力/触觉传感器和控制单元如果无法稳定供给,模型和本体设计都会被交付周期、成本和认证要求反向约束。
- 欧拉万象 把系统工程推进到家庭真实反馈闭环:创客产品、双臂底盘、本地数据采集、质检标注、模型训练、评测和用户反馈必须共同工作,才可能从“不完美但可学习”走向家庭可用。
- 量产能力不是制造后端问题,而是算法、数据、硬件、供应链和质量体系能否长期稳定运行的总和。
人机数据转换也是系统工程
- 人类活动数据 进入控制策略需要相机标定、3D/SLAM 重建、动作表示、机器人运动学过滤、控制延迟、目标本体数据和部署纠错共同工作。
- Universal Manipulation Interface 的 relative trajectory 和 latency matching、EgoMimic 的相机坐标 pose 与机器人 joint grounding 都说明:数据格式不能脱离传感器、硬件和执行器约束单独评价。
- DROID 的整库共同训练外部反例表明,多场景规模不会自动转成目标任务收益;对象、技能、相机和空间对齐是系统的一部分。
- LeRobot HIL 进一步把评测推进到控制权切换:自主成功、人工辅助完成、介入次数/时长和失败恢复必须分开统计,才能判断闭环是否真的改善。
相关页面
- 墨奇智能
- 黄青虬
- 具身智能数据基础设施
- 世界模型
- 物理 AI 创业生态
- 知跃空间智能
- 凌川科技
- 中试平台
- 源策未来
- 李弘扬
- 全身智能
- 星海图
- 智平方科技
- LiberAI
- 人形机器人基础模型
- 人形机器人实景实训专项行动
- 星尘智能
- 灵初智能
- 深圳 AI 硬件生态
- 人形机器人供应链
- 欧拉万象
证据
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)
- 原始资料快照(本地归档)
- 星海图
- 智平方科技
- LiberAI
- 人形机器人基础模型
- 人形机器人实景实训专项行动
- 星尘智能
- 灵初智能
- 深圳 AI 硬件生态
- 人形机器人供应链
- 欧拉万象
2026-08-10 人类示范与部署纠错的系统接口
人类活动数据 的可用性取决于完整接口而非单一模型。EgoMimic 通过相似相机位置、分别归一化的人/机器人 pose 和共享策略网络连接两域;UMI 通过手持夹爪、相对轨迹、时延匹配和运动学检查减少部署错位;HIL-SERL 在真机循环中记录自动执行、接管、恢复和奖励。
系统验收因此应覆盖传感器同步、动作坐标、控制频率、SLAM/追踪失败、机器人可达性、力/触觉缺失、人工接管策略、训练/测试场景留出和安全事件。RoHIL 的跨光照结果说明,训练工作台成功率不能替代部署分布稳健性。
证据:原始资料快照(本地归档)
2026-08-10 补强:部署干预的数据状态机
部署纠错应被实现为显式的控制权状态机,而不是模糊的“人类反馈”:
- autonomous:策略控制机器人,并记录策略版本、观察、动作和安全状态;
- pause/takeover:触发阈值与操作者接管,暂停期间是否记录帧必须显式声明;
- recovery:先把机器人带回安全、可继续的状态;
- correction:在人类控制下示范正确动作;
- handoff:重新同步观察与控制权,再交还策略;
- retrain/evaluate:按 autonomous 与 intervention 分层采样、训练和评测。
每段轨迹应保存 control_authority、intervention、recovery/correction 边界、策略 checkpoint、机器人本体、时延、reset、安全停止、成功/失败和未记录区间。LeRobot v0.6.0 默认 record_autonomous=false 是一个实际反例:若只看到 HIL 标签却不知道配置,就可能误以为数据包含完整策略 rollout。这个工程链与人类活动数据、具身智能数据基础设施的来源分类必须一致。
人类数据路线的工程门槛(2026-08-10)
人类活动进入机器人策略不是单一模型问题,而是五个接口同时成立:观察视角与相机标定可比较;人体 pose 或手持接口能映射为机器人可执行动作;观测、推理和执行时延对齐;目标本体满足工作空间、关节极限与接触约束;真机部署能记录失败、恢复、安全事件和人工接管。EgoMimic、UMI 与 HIL-SERL 分别暴露了联合监督、SLAM/延迟和在线安全的系统瓶颈。只扩大第一视角视频,不能替代这些工程环节。
2026-08-10 数据 schema 与动作语义的系统边界
机器人数据管线至少要分别版本化:数据 corpus、仓库 revision、schema、转换脚本、训练 mixture 和策略 checkpoint。LeRobotDataset v3 能统一 Parquet/MP4 与 episode/task metadata,Open X-Embodiment 能用 RLDS 聚合异构数据,但格式兼容不等于动作语义兼容。
跨数据训练前应显式记录坐标系、absolute/delta/velocity action、末端执行器、控制频率、时间同步、相机标定、语言标注、失败筛选和 normalization statistics。DROID 数据集 的 36k 改进标定子集与 AgiBot World 的固定 LeRobot v2.1 commit 都说明 provenance 是模型行为的一部分;只写“LeRobot-compatible”不足以复现实验或判断许可。
证据:原始资料快照(本地归档)