Skip to content

世界模型与机器人学习

本文基于公开资料整理,模型与论文信息以官方发布为准。

世界模型是一种学习环境动态规律的生成式模型:给定当前状态和一个动作,它能预测环境的下一个状态。对机器人而言,世界模型就像一个可以「在脑内运行」的模拟器——智能体不必在真实环境中试错,而是先在学到的模型里「想象」未来的后果,再决定如何行动。

形态代表输入输出特点
潜空间动态模型Dreamer 系列隐状态 + 动作 → 下一隐状态紧凑高效,适合 RL 想象规划
视频生成式Cosmos、Sora文本/图像/动作 → 未来视频通用性强,物理一致性仍在完善
交互式世界生成Genie 系列单帧图像 → 可操作虚拟世界从「预测」走向「可玩的模拟器」
用途说明
仿真训练在想象空间中 rollout 大量经验,降低真机与物理仿真成本
规划在潜空间中进行模型预测控制,选择想象中回报最高的动作序列
数据增强生成合成的「动作-结果」训练对,缓解机器人数据稀缺

DeepMind 的 Dreamer 是「潜空间想象规划」的经典范式:先自监督学习环境的状态转移模型,再在学到的模型想象中用强化学习训练策略,而非与真实环境交互。DreamerV3(2023)以统一超参数横扫 150 多个任务,成为第一个在 Minecraft 中「采集钻石」的模型,验证了想象规划的通用性。

Cosmos 定位为「世界基础模型」,以视频生成为核心,为 Physical AI 提供数据引擎:把少量真实演示扩展为大规模合成视频与动作数据,配合 Omniverse 数字孪生为机器人与自动驾驶训练生成照片级训练素材。

DeepMind 的 Genie 系列能从单张图像生成交互式、可操作的虚拟世界(「基础世界模型」路线);OpenAI 的 Sora 则引发了「视频生成模型是否是隐式世界模拟器」的讨论——它能生成物理上大体合理的画面,但在精确物理一致性与因果推理上仍不完美。

两者分工可以概括为:世界模型提供「预测」,VLA 提供「行动」。世界模型评估候选动作的后果、生成训练数据;VLA 把感知与指令直接映射为动作。NVIDIA 的路线中,Cosmos(世界模型)负责数据引擎,GR00T(VLA)负责策略,二者构成完整的 Physical AI 训练闭环。

世界模型与仿真都绕不开「仿真到现实差距」:仿真器中的物理近似、渲染差异会导致真机性能大幅下降。常用缓解手段包括:

  • 域随机化(Domain Randomization):训练时随机化纹理、光照、摩擦、质量等参数,迫使策略学习对域变化鲁棒的表征;
  • 系统辨识:用真实数据校准仿真参数,缩小动力学差距;
  • 真机微调:仿真预训练 + 少量真机数据微调,兼顾成本与性能。

值得注意的是,世界模型本身也被用于缩短 Sim2Real 差距:用真实视频训练的世界模型生成的数据分布更接近现实,可以作为仿真器与现实之间的「中间层」,为策略提供更接近真机的训练体验。

世界模型是 Physical AI 技术栈中「认知」的一半:它让智能体能够在行动之前预演后果。随着视频生成能力的提升,世界模型正从研究工具演变为机器人训练的基础设施——为 VLA 策略供给数据、在想象中演练技能、在部署前验证行为。世界模型与 VLA 的融合,是当前具身智能最活跃的研究方向之一。