UMI-3D

UMI-3D

UMI-3D 是 Universal Manipulation Interface 的 LiDAR-inertial 变体:在手持平行夹爪上结合 LiDAR、IMU、硬件触发相机和夹爪宽度标记,以公制 SLAM 生成末端轨迹与三维地图。它当前的“3D”主要改善采集与几何标签,公开策略并不直接消费点云或深度。

硬件、成本与同步

项目 已核验口径 不能据此推出什么
完整手持器 1120g、285×175×300mm、80mm夹爪行程 不等于轻于原 UMI;论文没有操作疲劳或人体工学对照
作者成本 3D打印夹爪约US$50,LiDAR+相机约US$650;目标约RMB5000/US$700 不含主机、机器人、GPU;BOM未给打印件、紧固件和工时完整单价,不能写成全系统成本
传感器 Livox MID-360/S LiDAR与内置IMU、Hikrobot MV-CB013-A0UC-S相机、M12约185°鱼眼、ArUco夹爪宽度 软指形变只是被动顺应,不是触觉数据流
硬件时间 STM32向LiDAR发1Hz PPS与伪GPRMC,并分频为20Hz相机触发;LiDAR 10Hz、相机20Hz 两流不是“完全同频”;硬件触发也不替代后续匹配误差记录

采集时相机驱动读取共享内存中的 LiDAR ROS 时间戳并统一写入 rosbag。导出再以视频为主时间轴,把 SLAM 和辅助信号做最近邻匹配并设置容差,文档示例为10ms。因此更准确的描述是“共享时基的硬件同步采集 + 离线最近邻对齐”。

三层数据表示

  1. 采集层:RGB、LiDAR 点云、IMU 和夹爪宽度进入 rosbag。
  2. 标签层:LiDAR-inertial SLAM、外参和 ArUco 生成公制相机/末端 SE(3) 轨迹、三维地图与时序对齐。
  3. 策略层:当前公开 Zarr/config 只含 camera0_rgb、末端 position/rotation 和 gripper;动作是相对当前末端的未来 SE(3)+夹爪,horizon 16。策略实际输入为 RGB+proprio,没有 point cloud 或 depth。

作者在 policy issue #1 明确把直接3D观测策略列为未来方向。因而不能把“用 LiDAR 标定动作”写成“已证明点云策略更好”,也不能用采集端三维地图替代策略的部署观测说明。

数据、任务与作者结果

任务 训练数据 作者结果 关键失败边界
cup 3500 demos normalized seen/partial-unseen/full-unseen 为 .863/.788/.736 没有同任务原 UMI head-to-head
curtain 769 demos .88/.90/.96 任务与评分口径不同,不能与 cup 直接平均
door→grasp→place 340 demos 开门97.5%、抓杯47.5%、最终放置5% 32.5%已开门抓杯但因 IK/运动学约束放置失败
mouse 未用新的 UMI-3D demo 训练 4×4配置、每格5次,共80 trials,成功率.73–1.00 使用原 UMI 预训练策略零微调跨硬件部署,不能加进4609条训练 demos

前三项合计4609 demos。论文没有 ground-truth SLAM 误差、同任务 original-UMI 对照或点云观测消融;它支持“LiDAR可生成可用公制标签与部署轨迹”,不支持量化断言定位普遍优于原 UMI,也不支持跨本体无约束。

开放物、许可与独立证据

相关页面

证据