VLACVPR 20252025
InternVL: Scaling Up Vision Foundation Models
Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su et al.Shanghai AI Lab
摘要
InternVL scales up vision foundation models to 6 billion parameters. The model achieves state-of-the-art on diverse visual benchmarks including recognition, detection, and segmentation.
vision foundationscalingrecognitiondetectionsegmentationlarge-scale
技术细节
数据集
InternVL-Chat DataMMMUChartQA
模型骨架
InternViT-6B + InternLM2
编码器
InternViT-6B
解码器
InternLM2-Chat Decoder