世界模型
世界模型
世界模型正在沿两条方向扩展:一条是围绕机器人、自动驾驶、物理仿真和具身智能的物理世界模型;另一条是 社会世界模型 所代表的社会动力学和人类关系建模。两者都强调模型不只是生成内容,而是要表示行动后果、环境变化和可预测结构。
观察
- 清创荟世界模型论坛 把世界模型称为通用人工智能的关键基石,并将议题扩展到理论突破、数据引擎、仿真验证、机器人具身应用和自动驾驶。
- 以人为中心的具身模型范式 从具身智能角度强调:真正理解意味着能在物理世界行动,并理解行动改变环境所带来的后果。这与世界模型的直觉相关。
- 社会世界模型 把世界模型概念平移到社会关系、群体行为和制度结构。
- Mile Robotics 展示了仿真环境作为机器人训练和验证数据层的产业路线。
- 机器人触觉感知 和 模感科技 提示:如果世界模型要预测物理行动后果,它必须纳入接触、摩擦、滑移和受力变化,而不能只依赖视觉状态。
- 物理 AI 创业生态 显示,世界模型正在被创业公司用于物理 AGI、室内导航、接触交互预测和具身训练数据等不同产品叙事。
- World Labs 把世界模型推进到空间智能、持久 3D 世界、设计制造工作流和机器人仿真训练,说明 world model 正在成为物理世界 AI 的公司级融资叙事。
- 类脑具身智能 提示世界模型不一定替代 VLA 或控制模型;更可能作为机器人理解和预测环境的一部分,与低功耗控制、端侧适应共同组成系统。
- AI NPC 把世界模型问题带到游戏中:开放世界不只是生成环境,还需要角色记忆、情绪、任务状态和玩家行为之间形成可持续演化的状态系统。
- 世界模型创业热 提醒,“世界模型”正在同时作为技术概念、产品品类和融资标签流通,必须区分 renderer、simulator、planner 等功能层级。
- Worldscape-MoE 把世界模型推进到异源动作控制统一:相机轨迹、机械臂动作和第一人称手部动作不必被压成同一种格式,但需要共享对世界动态规律的建模。
- 家庭情感陪伴机器人 把世界模型扩展到家庭中的“人此刻怎么了”,提示情绪、关系和不打扰也可能成为世界状态的一部分。
- PixVerse 和 神经游戏引擎 展示了另一条路径:视频模型通过实时交互变成可导航、可编辑、可玩的世界表达,游戏成为检验 world model 是否能持续响应行动的早期场景。
- DW0.5 把世界模型放进具身后训练闭环:它作为 learned environment 模拟候选动作的未来 rollout,并把成功/失败反馈转化为训练信号。
- 具身智能系统工程 提醒,世界模型可以是稠密反馈的一种辅助线,而不是与 VLA 互斥的终局路线;关键在于它是否改善端侧闭环和真实任务表现。
- 知跃空间智能 把 Real2Sim2Real 和 4D 世界模拟器放进类脑 Physical AI 叙事中,提示世界模型也会作为融资和产品语言进入机器人软件底座。
- Agentive 系统 把世界模型放入更强自主性的 agent 架构中:如果 agent 要进行模拟推理和自我学习,世界模型就不只是环境生成器,也可能成为目标规划和安全审计对象。
- Looped World Models 把 loop engineering 推进到世界模型内部:latent state 通过多轮 refinement 更新,强调模型理解环境也可能需要迭代修正。
- MindSpace 把世界模型带到空间数据库和空间记忆层:物理空间可以被组织为可检索、带传感和心理响应的智能层。
- 因果世界模型 把世界模型推进到机制层:模型不仅要预测下一状态,还要表示行动、干预、反事实和结果之间的因果结构。
- Aether AI 是因果世界模型路线的公司节点,说明世界模型创业热正在从视频/3D/VLA/WAM 扩展到因果 AI。
- 星海图 的 Fast-WAM / G0.5 叙事提供了另一个落地边界:在机器人里,世界模型和 VLA 更可能走向融合,用于动作生成、反馈预测和低延迟控制,而不是作为互斥技术阵营。
- 智平方科技 的 Video2Act / NeuroVLA 叙事同样把世界模型放进 VLA 内部:世界模型提供短程空间预测和 corner case 数据补足,VLA/语言模型承担较长程任务规划。
- LiberAI 把世界模型解释为物理 action 到 state transition 的建模,强调通过预训练和视频/物理空间对齐处理物理数据稀缺,而不是只生成未来视频。
- PSI Lab 与 人形机器人基础模型 把世界模型进一步约束到 physical actionability:如果预测出的未来不能转成机器人可执行轨迹,它仍然主要是生成模型,而不是机器人控制闭环的一部分。
- ABot-Earth 提供了城市级 3D 生成方向:世界模型也可以作为空间内容生产和数字孪生底座,但这类模型还需要与机器人控制中的物理可执行性区分开。
- 世界模型技术路线 把当前分歧拆成 RSSM/latent dynamics、Transformer tokenization、diffusion/video generation、JEPA semantic prediction 和 embodied world model 等路线,说明“世界模型”不是单一架构。
- 人体模型 从人类身体侧补充了世界模型问题:与物理世界交互的不只有机器人和环境,也包括人的身体状态、动作反馈和学习过程。
- 心理世界模型 从心智侧补充了世界模型问题:具身智能体不仅要预测物理状态变化,还要建模人的意图、信念、情绪和社会互动。
- Meta 的 embodied agents 路线把 world modeling 明确放在感知、记忆、推理规划、行动控制和人机协作之间,说明世界模型正在从“预测环境”扩展成包含用户意图与社会语境的 agent 架构层。
- 潜空间数据同化 把世界模型问题带到大气系统:模型学习全球天气状态的 latent representation,并用物理一致性约束同化观测和预报。
- VAST 把世界模型问题带到 AI 3D 和可交互内容生产:它强调可编辑 3D 资产和引擎管线,提醒“造世界”可以先从资产和空间表达开始,但这与可行动仿真仍有技术边界。
- STReasoner 把世界模型问题带到复杂时空系统:模型需要理解节点、时间、空间传播和异常源,而不只是拟合下一步数值。
- 阶跃星辰 把世界模型放进多模态基础模型和国产芯片适配叙事中,说明 world model 不只在机器人公司里出现,也会成为基座模型公司的路线标签。
与其他页面关系
- 具身智能数据基础设施:世界模型需要真实或仿真的交互数据支撑。
- 以人为中心的具身智能:如果世界模型服务于家庭机器人,它还需要包含人的状态、意图和反馈。
- 清华具身智能创业生态:世界模型成为清华校友和投资路演组织中的显性议题。
- 境瞳科技:社会世界模型创业案例。
- 物理 AI 创业生态:世界模型从学术/论坛关键词进入创业公司产品语言。
- World Labs:空间智能和物理世界模型公司节点。
- AI NPC:游戏世界中的角色记忆、状态演化和交互 Agent。
- 世界模型创业热:世界模型从技术路线扩散为创业身份和融资叙事。
- Worldscape-MoE:异源动作控制和具身世界模型训练框架。
- 家庭情感陪伴机器人:家庭场景中的情感/关系状态建模。
- PixVerse:AI 视频公司向实时世界模型和游戏引擎扩展的案例。
- 神经游戏引擎:用神经模型替代部分渲染和环境动力学的交互式游戏系统。
- DW0.5:把世界模型用于 VLA 后训练和低成本试错的开源项目。
- 具身智能系统工程:世界模型、VLA、端侧控制和量产闭环之间的系统关系。
- 知跃空间智能:把类脑大小脑系统、Real2Sim2Real 和仿真平台组合成 Physical AI 公司叙事。
- Agentive 系统:世界模型在内生目标、身份和自我学习 agent 架构中的位置。
- Looped World Models:把 looped latent refinement 放入世界模型架构。
- MindSpace:空间智能、空间数据库和空间记忆层原型。
- 因果世界模型:把机制、反事实和干预纳入世界模型。
- Aether AI:因果世界模型公司节点。
- 星海图:VLA、世界模型、真实数据和机器人本体闭环的公司节点。
- 智平方科技:把世界模型、VLA 和类脑控制结合成机器人大脑路线的公司节点。
- LiberAI:以预训练和物理因果为核心叙事的世界模型创业公司节点。
- PSI Lab:把人形机器人数据、基础模型和物理世界模型放入同一研究链路的实验室节点。
- 人形机器人基础模型:把世界模型从视频预测推进到可执行轨迹和全身任务闭环。
- ABot-Earth:城市级 3D 原生世界模型和空间生成式 AI 产品节点。
- 世界模型技术路线:整理世界模型的路线分化和表征/生成/行动争议。
- 人体模型:把人的身体状态、动作和反馈建模为动态系统。
- 心理世界模型:把人的内部 mental states 和 Theory of Mind 推理纳入具身智能。
- 潜空间数据同化:大气状态估计、物理一致性和概率预报中的 latent representation 路线。
- VAST:AI 3D 资产生成、UGC 和可交互世界底座公司节点。
- STReasoner:时间序列、图结构和自然语言结合的时空推理模型节点。
- 阶跃星辰:多模态模型公司把世界模型、终端场景和模芯协同放进同一技术路线。
术语判别框架
“世界模型”不能仅凭自称归类。每次使用该标签时,至少应说明它接收什么状态/行动、预测什么、如何被下游任务使用,并按下列层级定位:
- 技术上位词:学习环境状态及其转移规律;是否显式生成视频不是必要条件。
- Renderer:根据条件生成看似一致的未来媒体或 3D 表达;如果输出不参与行动评估,它仍主要是生成器。
- Simulator:以行动为条件预测未来状态或观测,并能表达失败、接触和环境反应;关键是可用于评测,而不是只生成成功演示。
- Planner:比较候选行动、估计价值或风险,并将结果反馈给策略选择或训练;这是从预测器进入决策闭环的门槛。
- 具体架构:RSSM/latent dynamics、token Transformer、diffusion/video、JEPA 或 embodied hybrid 只是实现路线,不能彼此充当“世界模型”的唯一标准。
- 产业叙事:公司、融资或路演可以把“世界模型”当作身份标签;只有当模型、接口、输出和下游任务可核验时,才进一步归入 renderer、simulator 或 planner。路演参与和路线自述不能证明架构或产品能力。
这套框架回答了原来的术语未决项,也给 Worldscape-MoE 与 DW0.5 提供了统一标尺:前者公开了异源动作条件下的生成/评测框架,但独立功能复现仍不足;后者公开了 action-conditioned rollout 组件,Value Expert 缺失使其尚不能被写成完整 planner/VLA 后训练闭环。
补证
- 原始资料快照(本地归档)
机器人合成轨迹的证据分层(2026-08-10)
机器人场景进一步说明,renderer、simulator、planner 和训练辅助不能只按模型名字区分,而要追踪预测如何进入动作与数据闭环:
- DreamGen 是离线数据生成器:视频世界模型先生成神经轨迹,IDM/LAPA 再恢复伪动作,策略随后重训。论文主要使用 WAN2.1;GR00T-Dreams 是后来基于 Cosmos Predict2 的工程蓝图,不能继承同一真机效果。
- RLDX-1 在相邻链条中加入视频质量与动作—视频一致性两级过滤。其 24 任务控制消融从 41.0 提升到 50.1,但候选到保留率和筛选成本仍未公开。
- VLA-JEPA 与 FastWAM 把世界预测作为训练损失,部署时不再生成未来;LingBot-VA、DreamZero、Cosmos Policy 才在推理或规划时保留显式未来。把它们统称为生成视频策略会抹去部署差异。
- TOPReward 与 Robometer 是 rollout 评分器。LeRobot v0.6 同时提供 world-action models、reward models 和 rollout CLI,却没有自动把预测、打分、执行、筛选和重训串成一个闭环。
- DW0.5 当前公开代码支持 video/action,action expert 直接预测动作;Value Expert 明示待发布,因此尚不能写成完整三头 planner。
外部 dWorldEval 与 WMBench 指出,视频模型会把失败自我修正为成功,OOD 动作和长程 rollout 也会产生漂移。世界模型用于机器人时,至少要分别检验视觉质量、动作可解码、运动学可执行、动力学与接触敏感、失败保持、长程稳定和真机相关性。
证据:DreamGen、LeRobot v0.6、dWorldEval、WMBench、原始资料快照(本地归档)。
机器人世界模型的分层验收门槛(2026-08-10)
机器人世界模型压力测试 将“世界模型质量”拆成视觉/语义、运动学、动力学敏感、接触与失败保持、长程误差、IDM/动作可执行和真机相关性七层。各层不能相互替代:
- DreamGen Bench 与 WFM-Eval 主要是视频代理;VLM 分数和物体轨迹异常不能证明动作可执行。
- EVA 与 RoboWM-Bench 把视频接到 IDM/retargeting 和仿真执行,但仍混合生成、动作恢复与 simulator 误差。
- iKCE 的摩擦 regime-boundary sweep 能诊断动力学不敏感,却不测任务成功;dWorldEval 的失败/OOD/action shuffle 和 round trip 则补上 self-correction 与长程漂移。
- RoboWorld 的高策略级相关性与明显接触形变可以同时存在,说明聚合 r/ρ 不能替代单轨迹失败审计。
因此,renderer→simulator→planner 的升级必须同时给出动作因果性、失败保持、跨物理边界响应和真实结果校准;仅有漂亮视频、最终 success 或代码仓库都不够。证据见 原始资料快照(本地归档)。
奖励模型与策略闭环(2026-08-10)
机器人奖励模型 与 action-conditioned 世界模型 处在相邻但不同的层:前者对既有观察或轨迹输出 progress、success 或 preference,后者预测动作将如何改变未来状态。奖励分数只有被调用方送入样本加权、planner、环境 reward 或控制终止时,才进入策略闭环。
LeRobot v0.6 给出了一个可核验的中间案例:Robometer 与 TOPReward 的离线脚本先把 progress 写入 parquet,RA-BC 再用进度差改变 per-sample BC loss 并反传,因而确实属于离线策略改进;但仓库没有二者进入通用在线 RL、rollout 或实时控制的生产调用方。在线 actor→SAC learner 链只接入了 HIL-SERL 的 reward classifier,而且走的是 classifier 专用 predict_reward(),不是统一 compute_reward()。
这要求把“评分器已注册”“离线标签进入训练”“在线 reward 进入环境”“下一动作受其影响”分别核验,不能从统一 API 或高相关性指标直接推出 planner/控制能力。完整版本与独立压力测试见 原始资料快照(本地归档)。