VLA 模型:从 RT-2 到 π0
本文基于公开资料整理,模型与论文信息以官方发布为准。
什么是 VLA 模型
Section titled “什么是 VLA 模型”VLA(Vision-Language-Action,视觉-语言-动作)模型是一类端到端的机器人基础模型:输入相机图像与自然语言指令,直接输出机器人的动作序列。它把「看到什么」「听到什么」「做什么」统一到同一个神经网络中,不再依赖传统的感知—规划—控制分模块流水线。
VLA 与大语言模型(LLM)、视觉语言模型(VLM)的关系可以概括为一句话:VLA = VLM + 动作输出。主流做法有两种:
- 动作 token 化:把连续的动作(关节角度、末端位姿)离散化为词表中的 token,机器人动作像「文字」一样被自回归地生成(RT-2 是代表);
- 动作头:VLM 主干负责感知与理解,外接一个专门的动作生成头(action expert),用扩散或流匹配输出连续动作(π0 是代表)。
代表模型谱系
Section titled “代表模型谱系”| 模型 | 年份 | 机构 | 关键贡献 |
|---|---|---|---|
| RT-1 | 2022 | 大规模遥操作数据 + 模仿学习,仅视觉-动作 | |
| RT-2 | 2023 | 确立 VLA 范式:PaLI-X / PaLM-E 底座 + 动作 token | |
| RT-X / Open X-Embodiment | 2023 | 21 家机构联合 | 跨机构、跨本体的大规模机器人数据集 |
| Octo | 2024 | UC 伯克利 | 开源通用策略,支持多任务多本体微调 |
| π0 | 2024 | Physical Intelligence | 流匹配生成连续动作,高频灵巧操作 |
| Helix | 2025 | Figure | 双系统架构:VLM 慢思考 + 低层快控制 |
| GR00T N1 | 2025 | NVIDIA | 开源人形机器人基础模型(VLA + 系统 2 推理) |
动作表示:离散 token vs 连续生成
Section titled “动作表示:离散 token vs 连续生成”- 离散 token:实现简单、可复用 LLM 训练管线,但量化误差会限制动作精度与控制频率,适合低频任务;
- 连续扩散 / 流匹配:直接在连续动作空间生成,精度高、可输出高频动作块(action chunking),是 2024 年后的主流方向。
| 来源 | 说明 | 局限 |
|---|---|---|
| 遥操作演示 | 人类远程操纵机器人采集,质量高 | 成本高、规模有限 |
| 视频学习 | 从互联网人类操作视频中学习(如 RT-2、π0 的预训练) | 缺少动作标签,需借助动作表示迁移 |
| 仿真合成 | 在 Isaac Lab 等仿真器中大规模生成 | 存在 Sim2Real 差距 |
Helix 与 GR00T N1 都采用了类似「快与慢」的双系统设计:慢系统(VLM,约 1-2 Hz)负责理解指令、分解任务、选择策略;快系统(小型策略网络,100+ Hz)负责实时闭环控制。这与人脑的 System 1 / System 2 类比,兼顾语义理解与实时性。
VLA 与传统机器人栈的对比
Section titled “VLA 与传统机器人栈的对比”| 维度 | 传统感知-规划-控制栈 | VLA 端到端模型 |
|---|---|---|
| 管线 | 多模块手工设计,接口复杂 | 单一神经网络,端到端训练 |
| 泛化 | 依赖人工建模,新场景需重写逻辑 | 从大规模数据中学习,具备语义泛化 |
| 指令理解 | 依赖结构化任务定义 | 直接理解自然语言 |
| 可解释性 | 各模块行为可分析 | 黑盒,难以诊断 |
| 计算需求 | 可跑在低功耗嵌入式设备 | 需要边缘 GPU 推理 |
- 数据稀缺:机器人领域没有互联网级的语料,真机数据采集成本极高,这是与 LLM 最大的差异;
- 泛化能力:面对新物体、新场景、新本体时性能下降明显,跨本体迁移仍是开放问题;
- 实时性:灵巧操作需要 50-200 Hz 控制频率,大模型的推理延迟是硬瓶颈;
- 安全性:错误的动作会直接造成物理损害,容错与安全约束难以端到端学习。
- RT-2 论文:arxiv.org/abs/2307.15818
- π0 博客:physicalintelligence.company/blog/pi0
- Open X-Embodiment 论文:arxiv.org/abs/2310.08864