世界模型技术路线

世界模型技术路线

世界模型技术路线可以按“状态如何表示、未来如何预测、动作如何进入模型、预测如何转成策略”来区分。这个页面沉淀路线图,不把任何单一路线提升为已经胜出的答案。

观察

核心分歧

相关页面

证据

从世界预测到机器人动作的四条路径(2026-08-10)

同样使用视频或 latent prediction 的模型,进入机器人系统的方式至少有四种:

  1. 离线视频→伪动作→再训练DreamGenGR00T-Dreams 生成视频后以 IDM/LAPA 恢复动作。视频质量与动作可执行性是两个独立噪声门。
  2. 训练期 world loss→直接动作:VLA-JEPA 与 FastWAM 在训练时预测未来 latent/视频,部署时移除预测分支。其效果应由去掉 world loss 的消融判断,而不是以推理时能否播放视频判断。
  3. 推理期联合 world-action:LingBot-VA、DreamZero 和 Cosmos Policy 同时生成动作与未来状态,或用 best-of-N 规划;它们不经过离线 IDM 标注链。
  4. reward-only 打分:TOPReward 与 Robometer 消费现有轨迹并输出进度、成功或偏好;只有找到训练、RL 或候选选择的调用方,才能写成策略改进闭环。

RLDX-1 与 RoboCurate 表明,VLM 视频评分不足以识别 IDM 动作错配;模拟回放或 executability probe 是单独的过滤层。外部 dWorldEval/WMBench 又要求测试失败保持、action shuffle/OOD 动作、接触与长时漂移,不能把短视频视觉真实当作因果可控性。

比较这些路线时,应统一记录真实/合成计数与训练采样比、动作接口或恢复方式、候选与逐级保留率、生成和筛选 GPU-hours、任务/本体/场景、严格成功与 partial progress、代码/权重/数据许可,以及作者结果与独立复现。

证据:原始资料快照(本地归档)、RLDX-1dWorldEval

从“代码公开”到“可复现评测”的版本门槛(2026-08-10)

DW0.5 / OpenDW 的复跑前检说明,world-action model 的开放性至少要把四个 revision 作为同一复现单元记录:模型代码、checkpoint bundle、数据/normalization 和 benchmark harness。任何一层发生接口漂移,都不能只凭“仓库和权重已公开”宣称效果可复现。

案例证据与重开条件见 原始资料快照(本地归档)。

不同技术路线需要不同压力测试(2026-08-10)

机器人世界模型压力测试 表明,路线比较不能压成一个视频分数:

完整协议、效果量和 artifact/许可边界见 原始资料快照(本地归档)。

Reward-only 路线的五层接线(2026-08-10)

Reward-only 路线不能只按模型输出命名,应按调用链分成五层:模型推断、离线轨迹标注、reward-aware BC、在线 RL reward、在线控制/终止。机器人奖励模型 中的 LeRobot v0.6 样本说明,第 1–3 层可以成立而第 4–5 层仍然缺失。

因此,reward-only 应作为独立接入路线,不与 world-action policy、action-conditioned simulator 或 planner 混写。固定源码、模型卡矛盾与外部反例见 原始资料快照(本地归档)。