VLANeurIPS 20252025

VLA-RL: Reinforcement Learning for Vision-Language-Action Fine-Tuning

Kevin Black, Noah Brown, Sergey Levine, Pieter AbbeelUC Berkeley

摘要

We present VLA-RL, a reinforcement learning framework for fine-tuning vision-language-action models. VLA-RL uses reward signals from task completion to improve VLA policy performance, achieving significant gains over imitation learning baselines on challenging manipulation tasks.

reinforcement learningVLA fine-tuningreward signaltask completionpolicy improvement

技术细节

数据集
DROIDBridgeData V2Franka Kitchen
仿真平台
测试机器人
模型骨架

OpenVLA + PPO Fine-Tuning

编码器

SigLIP + Proprioceptive Encoder

解码器

LLM Decoder with RL Policy Head (32 layers)

京ICP备2026064258号-1