robotics
StarVLA-α: Reducing Complexity in Vision-Language-Action Systems
Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya JiastarVLA Team
摘要
视觉-语言-动作(VLA)模型已成为构建通用机器人智能体的有前景的范式。然而,VLA 领域仍然高度碎片化和复杂:现有方法在架构、训练数据、具身配置和特定基准工程方面差异很大。本文引入 StarVLA-α,一个简单但强大的基线,旨在在受控条件下研究 VLA 设计选择。StarVLA-α 刻意最小化架构和流程复杂性,以减少实验混杂因素并实现系统性分析。具体而言,作者重新评估了几个关键设计轴,包括动作建模策略、机器人特定预训练和接口工程。在 LIBERO、SimplerEnv、RoboTwin 和 RoboCasa 的统一多基准训练下,同一个简单基线仍然具有高度竞争力,表明强大的 VLM 骨干结合最小设计已经足以实现强大性能,而无需依赖额外的架构复杂性或工程技巧。值得注意的是,该单一通用模型在公开的真实世界 RoboChallenge 基准上比 π₀.₅ 高出 20%。
VLAVision-Language-ActionMinimal DesignStrong BaselineQwen3-VLAction ModelingRobot Pretraining
技术细节
数据集
LIBEROSimplerEnvRoboTwinRoboCasa (unified multi-benchmark training)
仿真平台
LIBEROSimplerEnvRoboTwinRoboCasa
测试机器人
ARX5 robot (RoboChallenge benchmark)
模型骨架
Qwen3-VL (VLM backbone)
编码器
Qwen3-VL (unified vision-language encoder)
解码器
MLP Action Head (lightweight, 3-layer)
论文深度解读
阅读完整解读本文包含详细的论文深度解读,涵盖模型架构、核心公式、数据策略、实验解剖等内容。