71
什么是Tensor Parallelism和Pipeline Parallelism?在模型部署中如何使用?
模型部署与推理优化中等
📋 面试问题
什么是Tensor Parallelism和Pipeline Parallelism?在模型部署中如何使用?
✅ 期望回答
Tensor Parallelism (TP,张量并行):
- 将单个Transformer层的参数矩阵在多个GPU间横向切分
- 每层计算涉及跨GPU通信(All-Reduce/All-Gather)
- 优点:加速效果好,减少单卡显存占用
- 缺点:通信开销大(需要高速NVLink/IB互联,单机多卡最佳)
- 适用:模型太大单卡装不下,需要多卡分摊
- 将整个模型纵向切分,不同层放在不同GPU上
- 类似工厂流水线:GPU 1处理Layers 1-20,传给GPU 2处理Layers 21-40...
- 优点:通信开销小(只在GPUs间传激活值),可跨节点
- 缺点:GPU利用率不均(Pipeline Bubble),复杂
#Tensor Parallelism#Pipeline#分布式