模型架构MoT被 6 篇论文引用

混合专家Transformer

Mixture of Transformers

定义

MoT是一种将混合专家(MoE)机制引入Transformer的架构,通过稀疏激活多个专家子网络来提升模型容量,同时保持推理时的计算效率。

详细介绍

<h3>核心概念</h3><p>MoT(Mixture of Transformers)将混合专家(Mixture of Experts, MoE)的稀疏计算范式与Transformer架构相结合。其核心思想是在Transformer的前馈网络层(FFN)中引入多个"专家"子网络,通过门控机制(Gating Network)为每个输入token动态选择少量激活的专家,从而在不显著增加推理计算量的前提下大幅扩展模型参数容量。</p><h3>技术原理</h3><p>在标准Transformer中,每个Transformer块包含一个自注意力层和一个前馈网络层。MoT将前馈网络层替换为多个并行的专家FFN和一个路由门控网络。门控网络根据输入token的特征,选择Top-K个专家(通常K=1或2)来处理该token,其余专家不参与计算。这种稀疏激活机制使得模型的总参数量可以远大于密集模型,但每次前向传播的实际计算量与较小的密集模型相当。训练时需要引入负载均衡损失(Load Balancing Loss)确保各专家被均匀使用。</p><h3>在机器人领域的应用</h3><p>MoT架构在大规模VLA模型中具有重要应用价值。机器人操控任务涉及极其多样的场景和物体类型,单一密集模型难以覆盖所有情况。MoT允许不同的专家子网络专注于不同类型的操控技能(如抓取、推动、旋转等),门控机制根据当前任务自动路由到最合适的专家。这种方法在保持推理速度的同时,显著提升了模型处理多样化任务的能力。</p><h3>代表性论文</h3><ul><li>Mixture-of-Experts Meets Instruction Tuning (Shen et al., 2024)</li><li>Mixtral of Experts (Jiang et al., 2024)</li><li>MoE-VLA: Mixture of Experts for Vision-Language-Action (2024)</li></ul>

术语信息

缩写

MoT

分类

模型架构

更新时间

2026/9/23

京ICP备2026064258号-1