Skip to content

VLA 模型:从 RT-2 到 π0

本文基于公开资料整理,模型与论文信息以官方发布为准。

VLA(Vision-Language-Action,视觉-语言-动作)模型是一类端到端的机器人基础模型:输入相机图像与自然语言指令,直接输出机器人的动作序列。它把「看到什么」「听到什么」「做什么」统一到同一个神经网络中,不再依赖传统的感知—规划—控制分模块流水线。

VLA 与大语言模型(LLM)、视觉语言模型(VLM)的关系可以概括为一句话:VLA = VLM + 动作输出。主流做法有两种:

  • 动作 token 化:把连续的动作(关节角度、末端位姿)离散化为词表中的 token,机器人动作像「文字」一样被自回归地生成(RT-2 是代表);
  • 动作头:VLM 主干负责感知与理解,外接一个专门的动作生成头(action expert),用扩散或流匹配输出连续动作(π0 是代表)。
模型年份机构关键贡献
RT-12022Google大规模遥操作数据 + 模仿学习,仅视觉-动作
RT-22023Google确立 VLA 范式:PaLI-X / PaLM-E 底座 + 动作 token
RT-X / Open X-Embodiment202321 家机构联合跨机构、跨本体的大规模机器人数据集
Octo2024UC 伯克利开源通用策略,支持多任务多本体微调
π02024Physical Intelligence流匹配生成连续动作,高频灵巧操作
Helix2025Figure双系统架构:VLM 慢思考 + 低层快控制
GR00T N12025NVIDIA开源人形机器人基础模型(VLA + 系统 2 推理)

动作表示:离散 token vs 连续生成

Section titled “动作表示:离散 token vs 连续生成”
  • 离散 token:实现简单、可复用 LLM 训练管线,但量化误差会限制动作精度与控制频率,适合低频任务;
  • 连续扩散 / 流匹配:直接在连续动作空间生成,精度高、可输出高频动作块(action chunking),是 2024 年后的主流方向。
来源说明局限
遥操作演示人类远程操纵机器人采集,质量高成本高、规模有限
视频学习从互联网人类操作视频中学习(如 RT-2、π0 的预训练)缺少动作标签,需借助动作表示迁移
仿真合成在 Isaac Lab 等仿真器中大规模生成存在 Sim2Real 差距

Helix 与 GR00T N1 都采用了类似「快与慢」的双系统设计:慢系统(VLM,约 1-2 Hz)负责理解指令、分解任务、选择策略;快系统(小型策略网络,100+ Hz)负责实时闭环控制。这与人脑的 System 1 / System 2 类比,兼顾语义理解与实时性。

维度传统感知-规划-控制栈VLA 端到端模型
管线多模块手工设计,接口复杂单一神经网络,端到端训练
泛化依赖人工建模,新场景需重写逻辑从大规模数据中学习,具备语义泛化
指令理解依赖结构化任务定义直接理解自然语言
可解释性各模块行为可分析黑盒,难以诊断
计算需求可跑在低功耗嵌入式设备需要边缘 GPU 推理
  1. 数据稀缺:机器人领域没有互联网级的语料,真机数据采集成本极高,这是与 LLM 最大的差异;
  2. 泛化能力:面对新物体、新场景、新本体时性能下降明显,跨本体迁移仍是开放问题;
  3. 实时性:灵巧操作需要 50-200 Hz 控制频率,大模型的推理延迟是硬瓶颈;
  4. 安全性:错误的动作会直接造成物理损害,容错与安全约束难以端到端学习。