VLAICLR 20252025
SpatialVLA: Exploring Spatial Reasoning for VLA
Zhenyu Wang, Zipeng Fu, Chelsea Finn, Jiajun WuStanford University
摘要
We present SpatialVLA, which enhances vision-language-action models with explicit spatial reasoning capabilities. SpatialVLA learns to reason about object positions, orientations, and spatial relationships, enabling precise manipulation in cluttered environments with complex spatial constraints.
spatial reasoningVLAobject positionorientationcluttered environment
技术细节
数据集
ScanNet++Replica3D-FUTURE
测试机器人
模型骨架
ViT-G/14 + 3D Spatial Encoder + LLM
编码器
ViT-G/14 + 3D Point Cloud Encoder
解码器
Spatial Reasoning Transformer (12 layers)