机器人奖励模型
机器人奖励模型
机器人奖励模型把观察、轨迹或视频与任务指令映射成 progress、success、preference 或 scalar reward。它可以减少人工逐帧标注,也可以给示范重加权、给强化学习提供 reward,或在部署时触发终止和恢复;但模型输出一个分数,不等于这些用途已经接通。
闭环分层
机器人学习里的“reward 已接入”至少有五种不同含义:
| 层级 | 数据流 | 对策略的实际影响 |
|---|---|---|
| 模型推断 | observation/video + instruction → score | 只有分数,本身不更新策略 |
| 离线标注 | dataset episode → progress parquet | 生成派生训练字段 |
| Reward-aware BC | progress → sample weight → policy loss → backward | 真实改变离线模仿学习梯度 |
| 在线 RL reward | env.step → reward → replay/learner | 影响在线价值与策略更新 |
| 在线控制/终止 | reward → done/recovery/action choice | 直接改变当前 rollout |
这种分层避免把“统一 API”“模型可加载”“reward 与时间相关”“离线 BC 有提升”和“在线控制闭环”混成同一件事。
LeRobot v0.6:成立的是离线半闭环
LeRobot v0.6.0 把 reward classifier、SARM、Robometer 与 TOPReward 放进统一配置和 factory,并为 reward model 定义 compute_reward()。固定比较 v0.6.0、v0.6.1 与 2026-08-10 main 后,实际调用链是:
- Robometer 和 TOPReward 在 LeRobot 中是 inference-only:它们没有可训练
forward(),lerobot-train会拒绝把它们当 reward model 从头训练。 - 二者的离线脚本会扫描既有 episode,把 progress 写成 SARM 兼容 parquet。
- RA-BC 读取 progress,按未来 action chunk 的进度增量生成样本权重;训练器请求 per-sample loss,做加权平均并反传。这证明 reward-derived 标签真实改变策略学习,而不是只用于 overlay。
- 仓库内没有 Robometer/TOPReward→环境、actor、learner 或 rollout 的生产 caller。统一 API 还不是通用在线 runtime。
- HIL-SERL 的 reward classifier 已进入在线 actor→SAC learner,但它通过专用
predict_reward()在env.step后写 reward/done,绕过统一compute_reward()。这条在线链不能外推给其他 reward model。
因此,LeRobot v0.6 的准确表述是:统一了 reward model 的一部分软件接口,交付了离线标注与 reward-aware BC,也保留一条 classifier 专用在线 RL 链;尚未把四种模型统一接入端到端在线策略改进。
模型卡与源码还有直接冲突:LeRobot 的 Robometer-4B 卡给出 --reward_model.type=robometer 从头训练命令,专页和源码却明确为 inference-only;SARM 文档仍写 --policy.type=sarm,源码路由实际属于 --reward_model.type=sarm。文档愿景不能替代生产 caller。
TOPReward:单 token 探针,不是校准概率
TOPReward 不训练专属 reward model,而是在冻结视频 VLM 上读取:
log P(True | video prefix, instruction, prompt)。
它读取 full-vocabulary 分布中的单个 True token,并非 True/False 二项归一概率。轨迹内 min-max 需要看到完整 episode,非因果,也会消除跨轨迹绝对尺度。所谓“免 calibration”最多表示不做任务专属后训练或不要求模型生成一个数值,不能推出输出已经是校准成功概率。
论文 v2 中 Qwen3-VL-8B 的 success ROC-AUC .939 也不是裸 P(True):它组合前后 prefix 的 True/False margin、整段视频的 Yes/No margin,再跨评估集轨迹做 z-score。项目页仍保留 v1 的 OXE 39 datasets、VOC .857 和末三帧 AUC .654;v2 的 Qwen3-VL-8B 已变成 filtered 33、VOC .874 和复合 AUC .939,二者不能混用。
作者在 6 个 SO-100 任务、每任务 50 条有噪示范和 10 次 trial 上报告 TOP-RWBC 优于普通 BC。这是离线 reward-weighted imitation learning,不是在线 RL;没有误差条或显著性检验,官方 repo 也没有公开相应 policy-training 实现。
Robometer:训练出的轨迹评分器,不是 policy
Robometer 在 Qwen3-VL-4B 上训练 progress、success 和 pairwise preference heads,最多使用 8 帧。RBM-1M 的论文口径为 1,059,370 条轨迹、21 种 embodiments。它可以在一条轨迹内给出细粒度分数,但训练 progress 大量由时间位置代理生成;不同数据源的 success cutoff 也是作者少量查看后设定,而非独立逐帧语义真值。
原作者报告 ID VOC .92、OOD VOC .94,以及 DSRL+PI0 单阶段成功率 base .20、RoboReward .55、Robometer .85。这些结果支持其作为候选 reward,但策略与真机证据均来自作者团队,不能称作独立复现。
公开权重与论文训练口径也未闭合:论文称 4×H200、6500 steps;仓库命令为 15000;公开 config 和 trainer state 又显示不同的 GPU 数与 step。OOD 数量在正文 976 和附录/公开数据 571 之间冲突。第三方能从 LeRobot 加载该模型,证明可运行性,不证明论文效果。
独立压力测试改变了什么
| 现象 | 外部证据 | 含义 |
|---|---|---|
| 停滞与 retry | World Value Models:TOPReward hesitation RMSE .31、retry VOC .00 | 成功示范上的单调相关性不能覆盖失败撤回;其 chat-template 协议又与 v2 no-chat 不同,属于压力测试而非精确复现 |
| 早期概率饱和 | LLM-as-a-Verifier:500 条轨迹上 TOPReward VOC .565,Robometer .780,verifier .966 | 单 token 分数可能过早到顶,失去中后段失败辨识;backbone 与官方协议不同 |
| 全局强、局部弱 | ReTVL:Robometer global VOC .994,但 Pre>Retry .086,严格有害 chunk retention .896 | 聚合全局排序不能替代局部错误和 retry 检验 |
| 在线 RL 未提升 | Large Reward Models:ManiSkill3 PI0.5 SFT 56.88,+Robometer 56.56 | 相关性强的离线 reward 不保证在给定 cadence 下改善 RL |
| 失败前置高奖励 | RARM:cloth-fold failure reward ratio Robometer .88 | 未完成却视觉接近目标的轨迹可能得到近完整奖励 |
| 短帧窗域移 | ProcVLM:局部短窗 VOC Robometer .5296,低于 ProcVLM .7282 | 累计 prefix、局部 history 和固定查询间隔是不同部署协议 |
这些研究与原方法多数没有完全匹配 checkpoint、prompt、frame schedule 和 cadence,因此不能写成“精确复现推翻”。它们更可靠地说明:奖励模型的可用性是协议条件性的,尤其依赖停滞、retry、失败保持、跨任务尺度和局部视觉变化是否进入评测。
系统验收清单
部署机器人奖励模型时,应同时报告:
- checkpoint 与固定 revision,模型卡是否与源码训练能力一致;
- instruction/prompt/chat template、answer token 与阈值;
- 累计 prefix、局部帧窗、抽帧方式和查询 cadence;
- progress 是否由时间位置、人工阶段、成功 cutoff 或稠密标注生成;
- 分数是否只写文件,还是进入 loss、backward、transition、done 或 action choice;
- 成功、失败、停滞、retry、误抓、近成功状态和长程任务的分项表现;
- 跨任务尺度或成功概率的校准方式,校准集是否和评估集分离;
- 任务、本体、trial、seed、误差条、独立作者关系和公开复现资产。
最重要的判别不是“模型会不会给 reward”,而是这个 reward 在什么协议下、经由哪条调用链、改变了哪个决策。
相关页面
- LeRobotDataset:progress parquet 属于派生训练标注,而不是原始真值。
- HIL-SERL:当前 LeRobot 中已成立的 classifier 专用在线奖励链。
- 世界模型:奖励评分器与 action-conditioned future predictor 的分工。
- 世界模型技术路线:reward-only、world-action policy 与 planner 的接入差异。
- 具身智能系统工程:从分数到训练和控制的运行时验收。
- 原始资料快照(本地归档):固定版本、源码调用链、效果量和来源边界。