VLANeurIPS 20252025
VLA-RL: Reinforcement Learning for Vision-Language-Action Fine-Tuning
Kevin Black, Noah Brown, Sergey Levine, Pieter AbbeelUC Berkeley
摘要
We present VLA-RL, a reinforcement learning framework for fine-tuning vision-language-action models. VLA-RL uses reward signals from task completion to improve VLA policy performance, achieving significant gains over imitation learning baselines on challenging manipulation tasks.
reinforcement learningVLA fine-tuningreward signaltask completionpolicy improvement
技术细节
数据集
测试机器人
Franka Emika PandaWidowX-250
模型骨架
OpenVLA + PPO Fine-Tuning
编码器
SigLIP + Proprioceptive Encoder
解码器
LLM Decoder with RL Policy Head (32 layers)