机器人奖励模型

机器人奖励模型

机器人奖励模型把观察、轨迹或视频与任务指令映射成 progress、success、preference 或 scalar reward。它可以减少人工逐帧标注,也可以给示范重加权、给强化学习提供 reward,或在部署时触发终止和恢复;但模型输出一个分数,不等于这些用途已经接通。

闭环分层

机器人学习里的“reward 已接入”至少有五种不同含义:

层级 数据流 对策略的实际影响
模型推断 observation/video + instruction → score 只有分数,本身不更新策略
离线标注 dataset episode → progress parquet 生成派生训练字段
Reward-aware BC progress → sample weight → policy loss → backward 真实改变离线模仿学习梯度
在线 RL reward env.step → reward → replay/learner 影响在线价值与策略更新
在线控制/终止 reward → done/recovery/action choice 直接改变当前 rollout

这种分层避免把“统一 API”“模型可加载”“reward 与时间相关”“离线 BC 有提升”和“在线控制闭环”混成同一件事。

LeRobot v0.6:成立的是离线半闭环

LeRobot v0.6.0 把 reward classifier、SARM、Robometer 与 TOPReward 放进统一配置和 factory,并为 reward model 定义 compute_reward()。固定比较 v0.6.0、v0.6.1 与 2026-08-10 main 后,实际调用链是:

因此,LeRobot v0.6 的准确表述是:统一了 reward model 的一部分软件接口,交付了离线标注与 reward-aware BC,也保留一条 classifier 专用在线 RL 链;尚未把四种模型统一接入端到端在线策略改进。

模型卡与源码还有直接冲突:LeRobot 的 Robometer-4B 卡给出 --reward_model.type=robometer 从头训练命令,专页和源码却明确为 inference-only;SARM 文档仍写 --policy.type=sarm,源码路由实际属于 --reward_model.type=sarm。文档愿景不能替代生产 caller。

TOPReward:单 token 探针,不是校准概率

TOPReward 不训练专属 reward model,而是在冻结视频 VLM 上读取:

log P(True | video prefix, instruction, prompt)

它读取 full-vocabulary 分布中的单个 True token,并非 True/False 二项归一概率。轨迹内 min-max 需要看到完整 episode,非因果,也会消除跨轨迹绝对尺度。所谓“免 calibration”最多表示不做任务专属后训练或不要求模型生成一个数值,不能推出输出已经是校准成功概率。

论文 v2 中 Qwen3-VL-8B 的 success ROC-AUC .939 也不是裸 P(True):它组合前后 prefix 的 True/False margin、整段视频的 Yes/No margin,再跨评估集轨迹做 z-score。项目页仍保留 v1 的 OXE 39 datasets、VOC .857 和末三帧 AUC .654;v2 的 Qwen3-VL-8B 已变成 filtered 33、VOC .874 和复合 AUC .939,二者不能混用。

作者在 6 个 SO-100 任务、每任务 50 条有噪示范和 10 次 trial 上报告 TOP-RWBC 优于普通 BC。这是离线 reward-weighted imitation learning,不是在线 RL;没有误差条或显著性检验,官方 repo 也没有公开相应 policy-training 实现。

Robometer:训练出的轨迹评分器,不是 policy

Robometer 在 Qwen3-VL-4B 上训练 progress、success 和 pairwise preference heads,最多使用 8 帧。RBM-1M 的论文口径为 1,059,370 条轨迹、21 种 embodiments。它可以在一条轨迹内给出细粒度分数,但训练 progress 大量由时间位置代理生成;不同数据源的 success cutoff 也是作者少量查看后设定,而非独立逐帧语义真值。

原作者报告 ID VOC .92、OOD VOC .94,以及 DSRL+PI0 单阶段成功率 base .20、RoboReward .55、Robometer .85。这些结果支持其作为候选 reward,但策略与真机证据均来自作者团队,不能称作独立复现。

公开权重与论文训练口径也未闭合:论文称 4×H200、6500 steps;仓库命令为 15000;公开 config 和 trainer state 又显示不同的 GPU 数与 step。OOD 数量在正文 976 和附录/公开数据 571 之间冲突。第三方能从 LeRobot 加载该模型,证明可运行性,不证明论文效果。

独立压力测试改变了什么

现象 外部证据 含义
停滞与 retry World Value Models:TOPReward hesitation RMSE .31、retry VOC .00 成功示范上的单调相关性不能覆盖失败撤回;其 chat-template 协议又与 v2 no-chat 不同,属于压力测试而非精确复现
早期概率饱和 LLM-as-a-Verifier:500 条轨迹上 TOPReward VOC .565,Robometer .780,verifier .966 单 token 分数可能过早到顶,失去中后段失败辨识;backbone 与官方协议不同
全局强、局部弱 ReTVL:Robometer global VOC .994,但 Pre>Retry .086,严格有害 chunk retention .896 聚合全局排序不能替代局部错误和 retry 检验
在线 RL 未提升 Large Reward Models:ManiSkill3 PI0.5 SFT 56.88,+Robometer 56.56 相关性强的离线 reward 不保证在给定 cadence 下改善 RL
失败前置高奖励 RARM:cloth-fold failure reward ratio Robometer .88 未完成却视觉接近目标的轨迹可能得到近完整奖励
短帧窗域移 ProcVLM:局部短窗 VOC Robometer .5296,低于 ProcVLM .7282 累计 prefix、局部 history 和固定查询间隔是不同部署协议

这些研究与原方法多数没有完全匹配 checkpoint、prompt、frame schedule 和 cadence,因此不能写成“精确复现推翻”。它们更可靠地说明:奖励模型的可用性是协议条件性的,尤其依赖停滞、retry、失败保持、跨任务尺度和局部视觉变化是否进入评测。

系统验收清单

部署机器人奖励模型时,应同时报告:

最重要的判别不是“模型会不会给 reward”,而是这个 reward 在什么协议下、经由哪条调用链、改变了哪个决策。

相关页面