VLA 模型

Vision-Language-Action Model


VLA 模型是什么?

VLA 模型(Vision-Language-Action Model,视觉-语言-动作模型)是一类端到端的具身智能大模型:输入是摄像头图像与自然语言指令(如"把杯子放进抽屉"),输出直接是机器人动作序列(关节角、末端位姿或夹爪指令)。它把感知、语义理解与运动生成压缩进同一个网络,是具身智能领域最受关注的策略架构之一。

与 LLM 的关系

VLA 通常在视觉-语言模型(VLM)的基础上扩展而来:先复用大语言模型的语义与常识能力,再把输出头改造为动作 token 或连续动作,从而让机器人"听得懂人话、看得懂场景"。可以把 VLA 理解为 LLM 家族向物理世界的延伸——语言模型预测下一个词,VLA 预测下一个动作。

为什么需要真机数据

互联网上有海量文本和图像,却几乎没有"图像 + 指令 → 关节动作"的配对数据。因此 VLA 训练高度依赖真机示教数据,主要通过遥操作采集;仿真数据可以补充规模,但需经 Sim-to-Real 弥合与实机的差距。数据的多样性(任务、场景、本体)往往比模型参数量更能决定泛化能力。

代表工作

  • RT-2(Google DeepMind):将 VLM 与机器人动作 token 联合训练,验证了"网络知识迁移到操作"的可行性;
  • OpenVLA:开源 VLA 模型,基于大规模开放机器人数据集训练,便于社区微调;
  • π0(Physical Intelligence):采用流匹配生成连续动作,面向跨本体的通用操作策略。

在真实平台上部署与微调 VLA,需要可稳定执行高频动作指令的本体——BXI 的人形机器人双臂机器人平台均提供 ROS2 接口,适合作为 VLA 研究的实机载体。