模型架构VLA被 15 篇论文引用

视觉-语言-动作模型

Vision-Language-Action Model

定义

VLA是一种将视觉感知、自然语言理解和机器人动作生成统一在单一端到端模型中的架构范式,通过大规模预训练实现从图像和语言指令到机器人控制动作的直接映射。

详细介绍

<h3>核心概念</h3><p>VLA(Vision-Language-Action)模型代表了具身智能领域最重要的架构范式之一。它将三大核心能力——视觉感知(Vision)、语言理解(Language)和动作生成(Action)——融合在一个统一的端到端神经网络中。与传统机器人系统中感知、规划、控制分离的流水线架构不同,VLA模型直接从原始图像像素和自然语言指令出发,输出机器人的低级控制动作。</p><h3>技术原理</h3><p>VLA模型通常采用预训练视觉-语言模型(如CLIP、PaLI)作为视觉编码器,结合大语言模型(如PaLM、LLaMA)的Transformer骨干网络,通过微调或从头训练的方式学习从视觉-语言输入到动作空间的映射。动作输出可以是离散的token序列(如RT-2将动作编码为文本token),也可以是连续的向量值(如关节角度、末端位姿)。训练数据通常来自大规模互联网图文数据和机器人操作演示数据的混合。</p><h3>在机器人领域的应用</h3><p>VLA模型已在桌面物体操控、厨房任务执行、物体抓取与放置等场景中展现出强大的泛化能力。代表性工作包括Google DeepMind的RT-2(2023)、Octo(2024)、OpenVLA(2024)等。这些模型能够理解自然语言指令(如"把红色杯子放到盘子上"),并根据当前视觉观测直接生成机械臂的控制序列。</p><h3>代表性论文</h3><ul><li>RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (Brohan et al., 2023)</li><li>OpenVLA: An Open-Source Vision-Language-Action Model (Kim et al., 2024)</li><li>Octo: An Open-Source Generalist Robot Policy (Octo Model Team, 2024)</li></ul>

术语信息

缩写

VLA

分类

模型架构

更新时间

2026/9/23

京ICP备2026064258号-1