Universal Manipulation Interface

Universal Manipulation Interface

Universal Manipulation Interface(UMI)是用机器人化手持夹爪采集人类操作示范,并把视觉、末端轨迹和夹爪状态转成可部署策略的接口与训练框架。它在采集端主动缩小人手与机器人末端执行器的差距;后续工作分别扩大采集规模、改善几何标签、增加灵巧手同构或接触事件监督,并没有形成一条可以按单一指标排序的升级链。

采集与动作表示

原版作者实验与外部复核

后续谱系解决的是不同误差项

系统 主要新增能力 采集/标签信息 策略实际输入 新约束与证据边界
FastUMI 用 T265、标准化安装与 ROS 流程提高吞吐 RGB、视觉惯性位姿与夹爪/机器人状态 RGB;深度版实际使用单目估计深度 T265 仍会遮挡漂移;论文规模与公开 artifact 有版本差,尚无同协议独立复现
FastUMI-100K 扩到单/双臂、论文总体 100k+ 与 54 tasks 双套 GoPro/T265,relative EEF action 腕部 RGB 与相对末端动作 当前公开 artifact 只核实 34,052 条双臂 episode、12 tasks;跨机器人仍需坐标映射和工作空间过滤
UMI-3D 用 LiDAR-inertial SLAM 改善公制轨迹与几何标签 RGB、LiDAR、IMU、夹爪宽度 当前公开策略仍为 RGB+proprio “3D”不等于点云策略;长任务最终放置仅 5%,运动学仍是瓶颈
DexUMI 用目标手专用外骨骼提高灵巧手动作同构 编码器、ARKit、RGB 与手型特定触觉 处理后 RGB+可选触觉 需要每种目标手重做映射和真实手 replay;触觉只在部分干净接触信号上增益
TacUMI(多模态事件分割) 把触觉、F/T、RGB 与双手 pose 用于接触阶段监督 非对称双手多模态流 没有操控策略;这些信号进入离线事件分割器 只有单任务约 30k frames;cross-platform 是分割评测,不是控制迁移

这组比较要求把四层输入分开:采集传感器、标签生成输入、训练观测和部署观测。LiDAR、mocap、ARKit、触觉或 F/T 出现在采集端,不足以证明策略直接使用这些模态,更不能自动推出跨本体控制增益。

开放状态与边界

相关页面

证据