OpenVLA-2: Open-Source Vision-Language-Action Model
摘要
We present OpenVLA-2, an open-source vision-language-action model for general-purpose robot control. OpenVLA-2 combines a powerful vision-language backbone with an action tokenizer, enabling robots to follow natural language instructions for diverse manipulation tasks with strong zero-shot generalization.
技术细节
SigLIP-So400m + Llama 2 7B
SigLIP So400m/14 + Proprioceptive MLP
Llama 2 7B Action Decoder (32 layers)







