世界模型技术路线
世界模型技术路线
世界模型技术路线可以按“状态如何表示、未来如何预测、动作如何进入模型、预测如何转成策略”来区分。这个页面沉淀路线图,不把任何单一路线提升为已经胜出的答案。
观察
- 严格意义上的 世界模型 不只是预测下一帧,而是以 action 为条件预测下一状态。这个条件把模型从旁观者变成参与者,也把视频生成、强化学习和机器人控制区分开来。
- RNN/MDN-RNN/RSSM 路线强调潜在空间动态和样本效率。Dreamer 系列的关键不是画出未来画面,而是在 latent dynamics 中进行想象、奖励估计和策略学习。
- Transformer 路线把状态和动作 token 化,追求长程建模和更高并行性。STORM 这类方法说明世界模型也会吸收语言模型架构经验,但动作条件和环境反馈仍然是差异所在。
- Diffusion/video generation 路线强调视觉质量和多样未来,但它的风险是“生成得像”不等于“物理可执行”。这与 人形机器人基础模型 和 PSI Lab 中 physical actionability 的判断一致。
- JEPA 路线放弃像素重建,转向语义表示预测。它的赌注是世界模型最重要的是表征结构,而不是渲染逼真的未来图像。
- 扩散语言模型 和 Cola DLM 提供了语言侧的相邻信号:从离散 token 迁移到连续 embedding/latent space,并不自动等于世界模型,但说明下一代模型路线可能更重视连续表征和预测结构。
- 灵初智能 的 R2/W0 叙事提供了具身公司化样本:策略模型和世界仿真/评估模型可以分开训练,让成功动作数据和失败反事实数据承担不同角色。
- VAST 提供了 AI 3D 资产路线的产业样本:可编辑拓扑、低面数引擎可用模型和全链路 3D 工作流,属于 3D 表达/生产基础设施,不应直接等同于 action-conditioned world model。
- Embodied world model 路线直接面对机器人数据稀缺:从人类视频、无标注视频或仿真中学习物理交互先验,再用少量机器人数据完成 embodiment 对齐。
- Datawhale 的 learn-world-model 项目把世界模型做成课程和可运行项目,说明世界模型正在从论文/融资词汇转向可教学、可复现实验的工程对象。
核心分歧
- 表征 vs 生成:模型应优先学习语义/物理结构,还是生成高质量未来视频。
- LLM 融合 vs 独立架构:多模态 LLM 是否足以吸收世界模型能力,还是需要从感知和行动信号重新建模。
- 现在能否规模化:视觉和物理数据的语义密度、采集成本、算力需求和评测标准是否已经支撑大规模押注。
相关页面
证据
- 原始资料快照(本地归档)
- learn-world-model
- 原始资料快照(本地归档)
- 灵初智能
- VAST