StarVLA Team 发布简洁高效的 VLA 基线模型 StarVLA-α:揭示复杂设计的必要性

StarVLA Team 发布简洁高效的 VLA 基线模型 StarVLA-α:揭示复杂设计的必要性

文章名:StarVLA-α: Reducing Complexity in Vision-Language-Action Systems
作者:Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia
机构:starVLA Team
arXiv:2604.11757
摘要

视觉-语言-动作(VLA)模型已成为构建通用机器人智能体的有前景的范式。然而,VLA 领域仍然高度碎片化和复杂:现有方法在架构、训练数据、具身配置和特定基准工程方面差异很大。本文引入 StarVLA-α,一个简单但强大的基线,旨在在受控条件下研究 VLA 设计选择。StarVLA-α 刻意最小化架构和流程复杂性,以减少实验混杂因素并实现系统性分析。具体而言,作者重新评估了几个关键设计轴,包括动作建模策略、机器人特定预训练和接口工程。在 LIBERO、SimplerEnv、RoboTwin 和 RoboCasa 的统一多基准训练下,同一个简单基线仍然具有高度竞争力,表明强大的 VLM 骨干结合最小设计已经足以实现强大性能,而无需依赖额外的架构复杂性或工程技巧。值得注意的是,该单一通用模型在公开的真实世界 RoboChallenge 基准上比 π₀.₅ 高出 20%。

一、问题与背景

视觉-语言-动作(VLA)模型近年来已成为构建通用机器人智能体的主流范式。自 2022 年 RT-1 发布以来,该领域在视觉骨干网络(如 SigLIP、DINO、CLIP)、动作头设计(离散 token、连续回归、扩散、流匹配)以及动作/数据管道(增量 vs 相对动作、跨具身特定预处理)等多个设计维度上进行了大量探索。这些选择推动了持续的性能提升,但也导致了领域的碎片化:系统变得复杂、难以复现,并且紧密调优到特定基准的细节,这损害了向新具身配置的迁移能力。

尽管 VLA 系统快速发展,该领域仍缺乏对哪些组件真正驱动性能提升的清晰理解。现有系统在模型架构、预训练数据、具身配置和特定基准微调方面存在差异,使得经验比较难以解释。报告的性能提升往往与数据集选择、预处理管道和特定基准工程纠缠在一起,模糊了性能增益是源于建模创新还是实验变异。与视觉-语言建模(VLM)领域逐渐收敛到标准化训练方案不同,VLA 研究仍然高度碎片化。建立更清晰的方法论共识对于指导该领域的未来进展日益重要。

然而,达成方法论共识面临挑战:VLA 系统涉及多个相互依赖的设计选择,包括视觉编码、语言理解、动作表示、数据预处理和训练策略。这些选择相互耦合,使得孤立地研究每个组件的影响变得困难。此外,不同基准使用不同的机器人配置、任务设置和评估协议,进一步增加了比较的复杂性。

StarVLA-α 的核心贡献在于:

(1)提出一个简单但强大的 VLA 基线,使用强大的 VLM 骨干(Qwen3-VL)配合轻量级 MLP 动作头,在多个基准上达到 SOTA 性能;
(2)通过受控实验系统研究关键设计选择,揭示许多复杂技术(如复杂的动作头设计、繁重的数据工程、任务特定预训练)并非通用机器人开发所必需;
(3)提供可复现、可迁移的框架,为未来 VLA 研究提供坚实的起点;
(4)在公开的真实世界 RoboChallenge 基准上,单一通用模型比 π₀.₅ 高出 20%。

二、模型架构

2.1 架构设计概述

StarVLA-α 的设计遵循最小充分性假设:强大的 VLM 配合轻量级动作头可以捕获通常归因于更复杂设计的大部分优势。这里的"简洁"体现在两个方面:最小化数据处理和简化的架构设计。

StarVLA-α 方法概览
图 2:StarVLA-α 概览。使用统一的 VLM 骨干(Qwen3-VL)配合最小化预处理和轻量级 MLP 动作头。这种简单设置避免了专门的视觉编码器、特定基准的数据管道和复杂的动作头,同时在多样化的基准上实现一致的训练和评估。

图 2 展示了 StarVLA-α 的整体架构。该框架使用 Qwen3-VL 作为统一的视觉-语言骨干网络,直接处理原始 RGB 图像和语言指令,无需专门的视觉编码器或特定基准的数据管道。动作预测通过轻量级的 3 层 MLP 动作头完成,输出连续的动作值。这种极简设计使得框架可以直接应用于新的机器人具身配置和基准,无需额外的适配。

2.2 输入与输出分析

输入:StarVLA-α 接收两种输入:(1)原始 RGB 图像,无需特定的预处理或格式化;(2)自然语言指令,描述要执行的任务。模型不使用专门的视觉编码器(如 CLIP、DINO),而是直接利用 Qwen3-VL 的统一视觉-语言处理能力。

输出:模型输出连续的动作值,维度根据机器人具身配置而定。为了解决不同机器人动作维度的差异,作者没有引入任何任务特定的设计,而是将自由度较低的机器人的动作空间进行填充,使所有动作向量在我们的设置中统一扩展到 32 维。这种统一的动作表示使得单一模型可以处理不同的机器人配置。

2.3 编码器与解码器

编码器:StarVLA-α 使用 Qwen3-VL 作为统一的视觉-语言编码器。Qwen3-VL 是通义千问团队开发的开源视觉-语言模型,具有强大的视觉理解和语言推理能力。选择 Qwen3-VL 的原因有两个:(i)它是一个广泛采用的开源 VLM,拥有强大的社区支持;(ii)其统一设计原生处理视觉和语言输入,避免了单独选择和组合视觉编码器(如 CLIP、DINO)的需要。

解码器:动作预测使用轻量级的 3 层 MLP 作为动作头。MLP 接收 Qwen3-VL 的输出特征,映射到连续的动作空间。与复杂的动作头设计(如扩散模型、流匹配)不同,MLP 动作头简单高效,训练和推理速度快。

2.4 核心网络架构

Backbone:StarVLA-α 使用 Qwen3-VL 作为骨干网络。Qwen3-VL 是通义千问团队开发的视觉-语言模型,具有强大的多模态理解能力。该模型原生支持视觉和语言输入的统一处理,避免了传统 VLA 系统中需要分别选择视觉编码器和语言模型然后进行融合的复杂性。

Attention 机制:Qwen3-VL 使用 Transformer 架构,包含自注意力机制。由于 VLA 任务需要全局的视觉-语言理解,模型使用双向注意力(Bidirectional Attention),允许所有 token 之间进行信息交互。这与自回归语言模型使用的因果注意力(Causal Attention)不同,后者只允许当前 token 关注之前的 token。

2.5 巧妙设计:统一动作空间

StarVLA-α 的一个巧妙设计是使用统一的 32 维动作空间来处理不同机器人具身配置的动作维度差异。传统方法通常为每个机器人设计特定的动作表示和预处理管道,这增加了系统的复杂性并降低了可迁移性。StarVLA-α 通过将低自由度机器人的动作空间进行零填充,使所有动作向量统一到 32 维。这种设计使得单一模型可以处理不同的机器人配置,无需任务特定的适配。

三、核心公式

3.1 动作归一化

动作归一化: a_norm = (a - μ) / σ
其中 μ 和 σ 分别是训练集动作的均值和标准差

StarVLA-α 使用简单的 z-score 归一化来处理动作数据。归一化仅使用训练集统计量(零均值、单位方差),确保训练和评估之间的一致性。这种简单的归一化策略避免了复杂的动作预处理管道,同时保证了数值稳定性。

该公式的物理含义是将动作值转换到标准正态分布,使得不同尺度的动作值具有可比性。在训练中,模型预测归一化后的动作值,然后在执行时反归一化到原始动作空间。这种设计简单高效,避免了复杂的动作缩放策略。

四、数据策略

4.1 最小化数据处理

StarVLA-α 采用最小化数据处理策略,在所有环境中使用单一的、最小的数据管道。模型接收原始 RGB 图像和提供的语言指令作为输入,不进行特定基准的工程或自定义格式化。这种统一的预处理使得框架可以直接应用于新的机器人具身配置和基准,无需额外的适配。

与现有方法不同,StarVLA-α 不使用复杂的动作转换(如增量动作 vs 绝对动作、末端执行器 vs 关节空间 vs 6D 位姿),而是直接使用原始的动作数据。这种设计选择基于一个假设:强大的 VLM 骨干可以直接从原始数据中学习有效的表示,无需人工设计的特征工程。

4.2 跨基准统一训练

StarVLA-α 在 LIBERO、SimplerEnv、RoboTwin 和 RoboCasa 四个基准上进行统一训练。这种跨基准训练策略使得单一模型可以学习多样化的任务和机器人配置,提高泛化能力。训练时,作者使用学习率 1×10⁻⁴,批量大小 256,在所有 5 个数据集上联合训练。

五、实验解剖

5.1 实验设置

训练超参数:学习率 1×10⁻⁴,批量大小 256,在 5 个数据集上联合训练。模型使用 Qwen3-VL 作为骨干网络,配合 3 层 MLP 动作头。

评估基准:

(1)LIBERO:包含空间、物体、目标和长程四类任务,共 40 个任务;
(2)SimplerEnv:包含 WidowX 和 Google VA/VM 两类机器人任务;
(3)RoboTwin 2.0:包含 clean 和 random 两类设置;
(4)RoboCasa-GR1:包含 24 个子任务的挑战性基准;
(5)RoboChallenge:公开的真实世界机器人基准。

基线方法:作者比较了专家设置(在单个数据集上训练)和通用设置(在所有数据集上联合训练)的结果。除了与 StarVLA-α 比较外,还评估了多个 SOTA 方法,如 π₀.₅ 和 GR00T-N1.6。

5.2 仿真实验

表 1:跨基准性能对比
方法 类型 LIBERO (avg) SimplerEnv (WidowX) RoboTwin 2.0 (clean) RoboCasa-GR1 (24 tasks)
OpenVLA-OFT 专家 97.1 31.3 63.0 –
π₀ 专家 94.1 27.1 58.8 46.42
GR00T-N1.6 通用 95.2 33.5 61.2 52.3
π₀.₅ 通用 96.8 35.2 64.5 58.1
StarVLA-α 通用 97.5 38.6 67.8 61.6

表 1 展示了 StarVLA-α 在四个基准上的性能对比。StarVLA-α 在所有基准上都达到了 SOTA 或竞争性性能。在 LIBERO 上,StarVLA-α 达到 97.5% 的平均成功率,超过 OpenVLA-OFT(97.1%)和 π₀.₅(96.8%)。在 SimplerEnv 上,StarVLA-α 在 WidowX 任务上达到 38.6%,显著超过 π₀.₅(35.2%)和 GR00T-N1.6(33.5%)。在 RoboTwin 2.0 上,StarVLA-α 达到 67.8%,超过所有基线方法。在具有挑战性的 RoboCasa-GR1 基准(24 个子任务)上,StarVLA-α 达到 61.6%,比 π₀.₅(58.1%)提升 3.5 个百分点。

这些结果表明,单一通用模型可以有效处理多样化的任务和机器人具身配置,支持为具身 AI 开发更统一的评估范式。值得注意的是,StarVLA-α 使用极简设计(单一 VLM 骨干 + 轻量级 MLP 动作头),而许多基线方法使用复杂的架构和特定基准的工程。

5.3 真实物理机器人实验

真实世界部署评估
图 5:真实世界部署评估。StarVLA-α 在真实机器人任务上的性能表现。

图 5 展示了 StarVLA-α 在真实机器人任务上的部署评估。作者在多个真实机器人平台上评估了模型的性能,包括不同的机器人配置和任务类型。实验结果表明,StarVLA-α 可以有效迁移到真实世界场景,展现出良好的泛化能力。

仿真可视化
图 4:仿真可视化。StarVLA-α 在仿真环境中的任务执行可视化。

图 4 展示了 StarVLA-α 在仿真环境中的任务执行可视化。可视化显示了模型在不同任务上的执行轨迹和成功率,证明了模型的有效性。

5.4 消融实验

作者进行了系统的消融实验,研究关键设计选择的影响。实验结果表明:

(1)复杂的动作头设计(如扩散模型、流匹配)相比简单的 MLP 动作头并未带来显著的性能提升;
(2)繁重的数据工程(如复杂的动作转换、特定基准的预处理)并非必要;
(3)任务特定的预训练对通用机器人开发的贡献有限;
(4)强大的 VLM 骨干是性能的关键因素,配合轻量级动作头即可达到 SOTA 性能。

这些发现表明,许多在 VLA 领域广泛采用的复杂技术并非严格必要,简化设计可以减少架构复杂性,最小化数据工程,并提供可复现和可迁移的框架。

六、总结与展望

本文介绍了 StarVLA-α,一个简单的 VLA 基线,将强大的 VLM 骨干与轻量级 MLP 动作头和最小化数据处理相结合,在多个基准和真实机器人任务上实现了强大的性能。StarVLA-α 的受控实验表明,许多复杂技术(如复杂的动作头设计、繁重的数据工程、任务特定预训练)并非通用机器人开发所必需。这种简化设计减少了架构复杂性,最小化了数据工程,并为未来 VLA 研究提供了可复现和可迁移的框架。

StarVLA-α 的核心启示是:在 VLA 领域,强大的基础模型(如 Qwen3-VL)已经足够强大,可以直接从原始数据中学习有效的表示,无需复杂的架构设计或繁重的数据工程。这一发现为未来 VLA 研究提供了重要的指导方向:与其追求复杂的架构创新,不如专注于构建更强的基础模型和更高质量的数据。

未来工作可以探索以下方向:(1)将 StarVLA-α 扩展到更多的机器人具身配置和任务类型;(2)研究如何将 StarVLA-α 与强化学习结合,实现从演示到自主学习的迁移;(3)探索多模态输入(如触觉、力反馈)的集成,提高模型的感知能力。

引用信息

@article{ye2026starvla,
  title={StarVLA-α: Reducing Complexity in Vision-Language-Action Systems},
  author={Ye, Jinhui and Gao, Ning and Yang, Senqiao and Zheng, Jinliang and Wang, Zixuan and Chen, Yuxin and Chen, Pengguang and Chen, Yilun and Liu, Shu and Jia, Jiaya},
  journal={arXiv preprint arXiv:2604.11757},
  year={2026}
}
京ICP备2026064258号-1