机器人RSS 20252025

VoxPoser: Composable 3D Value Maps for Manipulation

Wenlong Huang, Chen Wang, Ruohan Zhang, Yunzhu Li et al.Stanford

摘要

VoxPoser composes 3D value maps from language instructions for zero-shot robot manipulation. By leveraging vision-language models, VoxPoser generates spatial affordance maps without task-specific training.

3D value mapszero-shot manipulationvision-languagespatial affordancecomposable

技术细节

数据集
RoboMimicScanNetLanguage Instructions
仿真平台
测试机器人
模型骨架

LLM + Vision Foundation Model + 3D Value Maps

编码器

CLIP ViT + Depth Encoder + LLM

解码器

3D Value Map Generator + Motion Planner

京ICP备2026064258号-1