VLAICLR 20252025

SpatialVLA: Exploring Spatial Reasoning for VLA

Zhenyu Wang, Zipeng Fu, Chelsea Finn, Jiajun WuStanford University

摘要

We present SpatialVLA, which enhances vision-language-action models with explicit spatial reasoning capabilities. SpatialVLA learns to reason about object positions, orientations, and spatial relationships, enabling precise manipulation in cluttered environments with complex spatial constraints.

spatial reasoningVLAobject positionorientationcluttered environment

技术细节

数据集
ScanNet++Replica3D-FUTURE
测试机器人
模型骨架

ViT-G/14 + 3D Spatial Encoder + LLM

编码器

ViT-G/14 + 3D Point Cloud Encoder

解码器

Spatial Reasoning Transformer (12 layers)

京ICP备2026064258号-1