72
大模型推理延迟(TTFT/TPOT)如何优化?列出能想到的所有层面。
模型部署与推理优化困难
📋 面试问题
大模型推理延迟(TTFT/TPOT)如何优化?列出能想到的所有层面。
✅ 期望回答
两个核心延迟指标:
- TTFT (Time To First Token):用户提交请求到第一个token产生的时间
- TPOT (Time Per Output Token):后续每个token的生成时间
- 用最新GPU(H100 > A100);用高带宽内存(HBM3)
- GPU互联:NVLink + NVSwitch
- 量化:FP16 -> INT4(GPTQ/AWQ)
- 稀疏性:结构化/非结构化剪枝
- 架构简化:用GQA替代MHA(KV Cache缩小,更快计算)
- 模型蒸馏:用大模型蒸馏小模型
- 高效KV Cache管理(PagedAttention + vLLM)
- 算子融合(FlashAttention-2/3)
- 量化KV Cache(KV Cache也用INT8/INT4存储)
- CUDA Kernel优化(自定义算子 + Triton加速)
- Prompt缓存(高频System Prompt/Prefix缓存)
- 并行策略(数据并行 = 多副本;模型并行 = 大模型分发)
- 请求调度(短请求优先)
- 流式输出(SSE/WebSocket发送token流)
#延迟优化#TTFT#TPOT