71

什么是Tensor Parallelism和Pipeline Parallelism?在模型部署中如何使用?

模型部署与推理优化中等

📋 面试问题

什么是Tensor Parallelism和Pipeline Parallelism?在模型部署中如何使用?

✅ 期望回答

Tensor Parallelism (TP,张量并行):
  • 将单个Transformer层的参数矩阵在多个GPU间横向切分
  • 每层计算涉及跨GPU通信(All-Reduce/All-Gather)
  • 优点:加速效果好,减少单卡显存占用
  • 缺点:通信开销大(需要高速NVLink/IB互联,单机多卡最佳)
  • 适用:模型太大单卡装不下,需要多卡分摊

Pipeline Parallelism (PP,流水线并行):
  • 将整个模型纵向切分,不同层放在不同GPU上
  • 类似工厂流水线:GPU 1处理Layers 1-20,传给GPU 2处理Layers 21-40...
  • 优点:通信开销小(只在GPUs间传激活值),可跨节点
  • 缺点:GPU利用率不均(Pipeline Bubble),复杂

DeepSpeed策略:ZeRO-1(优化器状态分片)、ZeRO-2(梯度+优化器状态)、ZeRO-3(参数+梯度+优化器全分片) 实践选择:单机多卡 -> Tensor Parallel (TP=2/4/8);跨节点 -> TP + PP组合
#Tensor Parallelism#Pipeline#分布式