世界模型

世界模型

世界模型正在沿两条方向扩展:一条是围绕机器人、自动驾驶、物理仿真和具身智能的物理世界模型;另一条是 社会世界模型 所代表的社会动力学和人类关系建模。两者都强调模型不只是生成内容,而是要表示行动后果、环境变化和可预测结构。

观察

与其他页面关系

术语判别框架

“世界模型”不能仅凭自称归类。每次使用该标签时,至少应说明它接收什么状态/行动、预测什么、如何被下游任务使用,并按下列层级定位:

这套框架回答了原来的术语未决项,也给 Worldscape-MoEDW0.5 提供了统一标尺:前者公开了异源动作条件下的生成/评测框架,但独立功能复现仍不足;后者公开了 action-conditioned rollout 组件,Value Expert 缺失使其尚不能被写成完整 planner/VLA 后训练闭环。

补证

机器人合成轨迹的证据分层(2026-08-10)

机器人场景进一步说明,renderer、simulator、planner 和训练辅助不能只按模型名字区分,而要追踪预测如何进入动作与数据闭环:

外部 dWorldEval 与 WMBench 指出,视频模型会把失败自我修正为成功,OOD 动作和长程 rollout 也会产生漂移。世界模型用于机器人时,至少要分别检验视觉质量、动作可解码、运动学可执行、动力学与接触敏感、失败保持、长程稳定和真机相关性。

证据:DreamGenLeRobot v0.6dWorldEvalWMBench、原始资料快照(本地归档)。

机器人世界模型的分层验收门槛(2026-08-10)

机器人世界模型压力测试 将“世界模型质量”拆成视觉/语义、运动学、动力学敏感、接触与失败保持、长程误差、IDM/动作可执行和真机相关性七层。各层不能相互替代:

因此,renderer→simulator→planner 的升级必须同时给出动作因果性、失败保持、跨物理边界响应和真实结果校准;仅有漂亮视频、最终 success 或代码仓库都不够。证据见 原始资料快照(本地归档)。

奖励模型与策略闭环(2026-08-10)

机器人奖励模型 与 action-conditioned 世界模型 处在相邻但不同的层:前者对既有观察或轨迹输出 progress、success 或 preference,后者预测动作将如何改变未来状态。奖励分数只有被调用方送入样本加权、planner、环境 reward 或控制终止时,才进入策略闭环。

LeRobot v0.6 给出了一个可核验的中间案例:Robometer 与 TOPReward 的离线脚本先把 progress 写入 parquet,RA-BC 再用进度差改变 per-sample BC loss 并反传,因而确实属于离线策略改进;但仓库没有二者进入通用在线 RL、rollout 或实时控制的生产调用方。在线 actor→SAC learner 链只接入了 HIL-SERL 的 reward classifier,而且走的是 classifier 专用 predict_reward(),不是统一 compute_reward()

这要求把“评分器已注册”“离线标签进入训练”“在线 reward 进入环境”“下一动作受其影响”分别核验,不能从统一 API 或高相关性指标直接推出 planner/控制能力。完整版本与独立压力测试见 原始资料快照(本地归档)。