HIL-SERL
HIL-SERL
HIL-SERL 是把离线人类示范、真机在线强化学习和部署时人工干预组合起来的视觉机器人学习系统。它采集的是机器人本体实际经历的状态、动作、奖励与恢复,因此与自然人类视频和接口示范处在不同数据层。
数据闭环
- 少量遥操作样本同时用于训练二元奖励分类器和初始化示范 replay buffer。
- 真机 actor 持续探索,learner 用 Soft Actor-Critic 更新策略;人类可在危险或无效行为出现时接管并示范恢复。
- LeRobot 的通用 HIL 文档允许自动策略与人类在同一 episode 中多次交接,连续记录自动执行、恢复和纠正,再用原始示范与 HIL 数据共同微调。
- 与只记录成功示范相比,这种结构主动采集策略自己的分布偏移和失败邻域。
作者结果与范围
HIL-SERL 论文通常使用约 20–30 条离线示范;作者报告在动态操作、精密装配与双臂协作等任务上,1–2.5 小时真机训练达到接近满分的成功率,并相对其基线平均约 2 倍成功率、1.8 倍执行速度。
这些是作者在特定工作台、视觉配置、任务与安全控制下的结果,不是普适部署保证。LeRobot 教程也建议从 5–10 秒短任务开始,说明长程任务和复杂场景并未被教程默认覆盖。
独立负面边界
2026 年 RoHIL 论文报告,标准 HIL-RL 策略在移动到几米外、仅光照不同的工作台时可能显著失效。该工作使用世界模型重照明、旧环境 replay 和策略锚定改善跨光照迁移。这是对“训练工作台近乎完美成功率”的重要外部限制,但不是对 HIL-SERL 所有任务和硬件的全面复现。
因此 HIL 数据的价值应同时报告接管策略、人工负担、干预选择偏差、场景/光照留出、安全事件和无人工接管时的成功率,而不能只报告训练末期峰值。
相关页面
证据
- 原始资料快照(本地归档)
- HIL-SERL 论文
- HIL-SERL 项目页
- LeRobot HIL 数据采集文档
- LeRobot HIL-SERL 教程
- RoHIL 论文
与 LeRobot DAgger 数据采集的区分
HIL-SERL 把奖励分类器、在线 Soft Actor-Critic、示范 replay 与人工接管组合为强化学习系统;LeRobot v0.6.0 的通用 DAgger/HIL 数据采集则把自主片段与人工恢复/纠正片段聚合后继续做模仿学习微调。两者共享“在策略访问的失败邻域采数据”,但训练目标、数据字段、风险与效果证据不同,不能用 HIL-SERL 的论文成功率替代 LeRobot DAgger 实现的独立验证。精确实现的复现缺口见 Bead luwiki-4i3.7。