世界模型技术路线

世界模型技术路线可以按“状态如何表示、未来如何预测、动作如何进入模型、预测如何转成策略”来区分。这个页面沉淀路线图,不把任何单一路线提升为已经胜出的答案。

观察

核心分歧

相关页面

证据

从世界预测到机器人动作的四条路径(2026-08-10)

同样使用视频或 latent prediction 的模型,进入机器人系统的方式至少有四种:

  1. 离线视频→伪动作→再训练:[[DreamGen]] 与 [[GR00T-Dreams]] 生成视频后以 IDM/LAPA 恢复动作。视频质量与动作可执行性是两个独立噪声门。
  2. 训练期 world loss→直接动作:VLA-JEPA 与 FastWAM 在训练时预测未来 latent/视频,部署时移除预测分支。其效果应由去掉 world loss 的消融判断,而不是以推理时能否播放视频判断。
  3. 推理期联合 world-action:LingBot-VA、DreamZero 和 Cosmos Policy 同时生成动作与未来状态,或用 best-of-N 规划;它们不经过离线 IDM 标注链。
  4. reward-only 打分:TOPReward 与 Robometer 消费现有轨迹并输出进度、成功或偏好;只有找到训练、RL 或候选选择的调用方,才能写成策略改进闭环。

[[RLDX-1]] 与 RoboCurate 表明,VLM 视频评分不足以识别 IDM 动作错配;模拟回放或 executability probe 是单独的过滤层。外部 dWorldEval/WMBench 又要求测试失败保持、action shuffle/OOD 动作、接触与长时漂移,不能把短视频视觉真实当作因果可控性。

比较这些路线时,应统一记录真实/合成计数与训练采样比、动作接口或恢复方式、候选与逐级保留率、生成和筛选 GPU-hours、任务/本体/场景、严格成功与 partial progress、代码/权重/数据许可,以及作者结果与独立复现。

证据:[[raw/2026-08-10-合成轨迹与机器人世界模型公开证据]]、RLDX-1、dWorldEval。

从“代码公开”到“可复现评测”的版本门槛(2026-08-10)

[[DW0.5]] / [[OpenDW]] 的复跑前检说明,world-action model 的开放性至少要把四个 revision 作为同一复现单元记录:模型代码、checkpoint bundle、数据/normalization 和 benchmark harness。任何一层发生接口漂移,都不能只凭“仓库和权重已公开”宣称效果可复现。

案例证据与重开条件见 [[raw/2026-08-10-DW0.5版本与RobotWin复跑审计]]。

不同技术路线需要不同压力测试(2026-08-10)

[[机器人世界模型压力测试]] 表明,路线比较不能压成一个视频分数:

完整协议、效果量和 artifact/许可边界见 [[raw/2026-08-10-机器人视频世界模型压力测试证据]]。

Reward-only 路线的五层接线(2026-08-10)

Reward-only 路线不能只按模型输出命名,应按调用链分成五层:模型推断、离线轨迹标注、reward-aware BC、在线 RL reward、在线控制/终止。[[机器人奖励模型]] 中的 LeRobot v0.6 样本说明,第 1–3 层可以成立而第 4–5 层仍然缺失。

因此,reward-only 应作为独立接入路线,不与 world-action policy、action-conditioned simulator 或 planner 混写。固定源码、模型卡矛盾与外部反例见 [[raw/2026-08-10-LeRobot奖励模型闭环核验]]。

2026-08-21:Evaluator—intervention—data regeneration 闭环

[[Current Robotics]]与[[光轮智能]]提供了两种相邻但不同的产业化路线。

两条路线的共同验收标准是:世界模型评测必须与真机结果校准,保留失败而不是系统性乐观,并把模型版本、训练数据、评测任务、失败类型、人工纠正和下一轮数据变更关联起来。合作公告或相关性图不能替代 action shuffle、OOD、接触/力、长时漂移、跨本体与真实部署验证。

证据:[[raw/2026-08-21-Current-Robotics-HumanEx-Curr-0与世界模型核验]]、[[raw/2026-08-21-光轮智能数据评测部署闭环与黎曼动力合作核验]]。

2026-08-26 enrich|SYNWorld

章鱼动力在WRC 2026发布[[SYNWorld]],区分ACWM动作可控世界模型与WAM世界动作模型:前者用于根据动作预测未来状态、辅助仿真评估,后者同时预测结果并生成机器人动作。媒体给出的V0.5参数口径存在“160亿”与“10B+”差异;公司所称部分场景虚实评估一致性超过80%尚无公开第三方基准。该案例可用于观察世界模型从视频预测走向动作条件建模,但不能据此确认通用操作能力。

证据:[[raw/2026-08-26-章鱼动力WRC产品发布与验证边界]]。