机器人RSS 20252025
VoxPoser: Composable 3D Value Maps for Manipulation
Wenlong Huang, Chen Wang, Ruohan Zhang, Yunzhu Li et al.Stanford
摘要
VoxPoser composes 3D value maps from language instructions for zero-shot robot manipulation. By leveraging vision-language models, VoxPoser generates spatial affordance maps without task-specific training.
3D value mapszero-shot manipulationvision-languagespatial affordancecomposable
技术细节
数据集
测试机器人
Franka Emika PandaWidowX-250
模型骨架
LLM + Vision Foundation Model + 3D Value Maps
编码器
CLIP ViT + Depth Encoder + LLM
解码器
3D Value Map Generator + Motion Planner