[{"data":1,"prerenderedAt":107},["ShallowReactive",2],{"\u002Fglossary\u002Fvla-model":3},{"id":4,"title":5,"alternateName":6,"body":7,"description":97,"extension":98,"keywords":99,"meta":100,"navigation":101,"path":102,"seo":103,"stem":104,"updated":105,"__hash__":106},"glossary\u002Fglossary\u002Fzh\u002Fvla-model.md","VLA 模型","Vision-Language-Action Model",{"type":8,"value":9,"toc":90},"minimark",[10,15,28,33,36,39,52,55,77],[11,12,14],"h1",{"id":13},"vla-模型是什么","VLA 模型是什么？",[16,17,18,21,22,27],"p",{},[19,20,5],"strong",{},"（Vision-Language-Action Model，视觉-语言-动作模型）是一类端到端的具身智能大模型：输入是摄像头图像与自然语言指令（如\"把杯子放进抽屉\"），输出直接是机器人动作序列（关节角、末端位姿或夹爪指令）。它把感知、语义理解与运动生成压缩进同一个网络，是",[23,24,26],"a",{"href":25},"\u002Fglossary\u002Fembodied-ai","具身智能","领域最受关注的策略架构之一。",[29,30,32],"h2",{"id":31},"与-llm-的关系","与 LLM 的关系",[16,34,35],{},"VLA 通常在视觉-语言模型（VLM）的基础上扩展而来：先复用大语言模型的语义与常识能力，再把输出头改造为动作 token 或连续动作，从而让机器人\"听得懂人话、看得懂场景\"。可以把 VLA 理解为 LLM 家族向物理世界的延伸——语言模型预测下一个词，VLA 预测下一个动作。",[29,37,38],{"id":38},"为什么需要真机数据",[16,40,41,42,46,47,51],{},"互联网上有海量文本和图像，却几乎没有\"图像 + 指令 → 关节动作\"的配对数据。因此 VLA 训练高度依赖真机示教数据，主要通过",[23,43,45],{"href":44},"\u002Fglossary\u002Fteleoperation","遥操作","采集；仿真数据可以补充规模，但需经 ",[23,48,50],{"href":49},"\u002Fglossary\u002Fsim-to-real","Sim-to-Real"," 弥合与实机的差距。数据的多样性（任务、场景、本体）往往比模型参数量更能决定泛化能力。",[29,53,54],{"id":54},"代表工作",[56,57,58,65,71],"ul",{},[59,60,61,64],"li",{},[19,62,63],{},"RT-2","（Google DeepMind）：将 VLM 与机器人动作 token 联合训练，验证了\"网络知识迁移到操作\"的可行性；",[59,66,67,70],{},[19,68,69],{},"OpenVLA","：开源 VLA 模型，基于大规模开放机器人数据集训练，便于社区微调；",[59,72,73,76],{},[19,74,75],{},"π0","（Physical Intelligence）：采用流匹配生成连续动作，面向跨本体的通用操作策略。",[16,78,79,80,84,85,89],{},"在真实平台上部署与微调 VLA，需要可稳定执行高频动作指令的本体——BXI 的",[23,81,83],{"href":82},"\u002Frobots\u002Fhumanoid-robot","人形机器人","与",[23,86,88],{"href":87},"\u002Frobots\u002Frobotic-arms","双臂机器人平台","均提供 ROS2 接口，适合作为 VLA 研究的实机载体。",{"title":91,"searchDepth":92,"depth":92,"links":93},"",2,[94,95,96],{"id":31,"depth":92,"text":32},{"id":38,"depth":92,"text":38},{"id":54,"depth":92,"text":54},"VLA 模型接收视觉信息和自然语言指令并输出机器人动作，是具身智能操作策略的一类端到端架构。","md","VLA模型, vision language action model, 具身智能大模型, robot foundation model, 端到端机器人策略",{},true,"\u002Fglossary\u002Fzh\u002Fvla-model",{"title":5,"description":97},"glossary\u002Fzh\u002Fvla-model",null,"3QzcfODAD8a9xg9a8OdKSi44M0voI9p8TqVYFEnTBxs",1785156466998]