Transformer架构
Transformer Architecture
定义
Transformer是一种基于自注意力机制的深度学习架构,通过并行计算序列中所有位置之间的依赖关系,已成为大语言模型和视觉模型的基础骨干网络。
详细介绍
<h3>核心概念</h3><p>Transformer由Vaswani等人在2017年的"Attention Is All You Need"论文中提出,彻底改变了深度学习领域的架构范式。它摒弃了传统的循环神经网络(RNN)和卷积神经网络(CNN),完全基于自注意力(Self-Attention)机制来建模序列数据中的长距离依赖关系。Transformer的核心优势在于其并行计算能力和对全局上下文的建模能力。</p><h3>技术原理</h3><p>Transformer由编码器和解码器组成,每个模块包含多层自注意力层和前馈神经网络层。自注意力机制通过计算Query、Key、Value三个向量之间的点积注意力权重,实现对序列中任意两个位置之间关系的直接建模。多头注意力(Multi-Head Attention)允许模型在不同的表示子空间中同时关注不同类型的关系。位置编码(Positional Encoding)为模型提供序列顺序信息。Transformer的计算复杂度为O(n²),但可以通过Flash Attention等优化技术降低实际开销。</p><h3>在机器人领域的应用</h3><p>Transformer已成为现代机器人学习模型的核心骨干。在VLA模型中,Transformer同时处理视觉token序列和语言token序列,通过自注意力和交叉注意力实现多模态融合。在动作预测中,Transformer可以将动作序列建模为token序列,利用自回归生成或双向编码方式预测未来动作。代表性应用包括RT-2、Octo、π0等VLA模型,以及基于Transformer的扩散策略(Diffusion Policy)。</p><h3>代表性论文</h3><ul><li>Attention Is All You Need (Vaswani et al., 2017)</li><li>Vision Transformer (ViT) (Dosovitskiy et al., 2021)</li><li>RT-2: Vision-Language-Action Models (Brohan et al., 2023)</li></ul>
术语信息
Transformer
模型架构
2026/9/23