VLA ModelsarXiv preprint2025

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil et al.Stanford University

摘要

We present RLinf-VLA, a unified framework for applying reinforcement learning to Vision-Language-Action models. Our approach enables efficient RL fine-tuning of VLAs through a novel reward shaping and policy optimization scheme, significantly improving robot manipulation performance with minimal additional data.

reinforcement learningVLAunified frameworkefficient trainingvision-language-action

技术细节

仿真平台
测试机器人
模型骨架

VLA Transformer

编码器

SigLIP

解码器

RL-optimized Action Head

相关公司(1)

京ICP备2026064258号-1