VLACVPR 20252025

InternVL: Scaling Up Vision Foundation Models

Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su et al.Shanghai AI Lab

摘要

InternVL scales up vision foundation models to 6 billion parameters. The model achieves state-of-the-art on diverse visual benchmarks including recognition, detection, and segmentation.

vision foundationscalingrecognitiondetectionsegmentationlarge-scale

技术细节

数据集
InternVL-Chat DataMMMUChartQA
模型骨架

InternViT-6B + InternLM2

编码器

InternViT-6B

解码器

InternLM2-Chat Decoder

京ICP备2026064258号-1