自蒸馏无标签学习
Self-Distillation with No Labels
定义
DINO是一种无需标注的自监督视觉表征学习方法,通过自蒸馏机制从图像中学习高质量的视觉特征。
详细介绍
<h3>核心概念</h3><p>DINO(Self-Distillation with No Labels)是由Meta AI提出的自监督视觉表征学习方法。其核心创新在于完全不需要人工标注,仅通过图像自身的不同视图之间的自蒸馏来学习视觉特征。</p><h3>技术原理</h3><p>DINO采用教师-学生(Teacher-Student)架构。学生网络接收图像的一个增强视图,教师网络接收同一图像的另一个增强视图。教师网络的参数是学生网络参数的指数移动平均(EMA)。通过最小化两个网络输出之间的交叉熵损失,学生网络学习生成与教师网络一致的表征。关键技巧包括:多裁剪策略(multi-crop)、中心化与锐化(centering and sharpening)防止模型坍塌。</p><h3>在机器人领域的应用</h3><p>DINO及其后续版本DINOv2在机器人视觉感知中被广泛使用。其学到的视觉特征具有强大的语义理解能力,可用于物体识别、场景理解、视觉导航等任务。在VLA模型中,DINO特征常作为视觉编码器的输出,为策略模型提供高质量的视觉表征。</p><h3>代表性论文</h3><ul><li>Emerging Properties in Self-Supervised Vision Transformers (Caron et al., 2021)</li><li>DINOv2: Learning Robust Visual Features without Supervision (Oquab et al., 2023)</li></ul>
术语信息
DINO
视觉表征
2026/9/24