分布式训练TP0张量并行Tensor Parallelism定义将模型的单个算子(如矩阵乘法)拆分到多个GPU上并行执行详细介绍张量并行将模型中的大矩阵运算拆分到多个GPU上,每个GPU负责计算矩阵的一部分。适用于模型太大无法放入单个GPU的场景。在Transformer中,通常对注意力层和MLP层进行张量并行拆分。术语信息缩写TP分类分布式训练更新时间2026/9/24