分布式训练TP0

张量并行

Tensor Parallelism

定义

将模型的单个算子(如矩阵乘法)拆分到多个GPU上并行执行

详细介绍

张量并行将模型中的大矩阵运算拆分到多个GPU上,每个GPU负责计算矩阵的一部分。适用于模型太大无法放入单个GPU的场景。在Transformer中,通常对注意力层和MLP层进行张量并行拆分。

术语信息

缩写

TP

分类

分布式训练

更新时间

2026/9/24

京ICP备2026064258号-1