72

大模型推理延迟(TTFT/TPOT)如何优化?列出能想到的所有层面。

模型部署与推理优化困难

📋 面试问题

大模型推理延迟(TTFT/TPOT)如何优化?列出能想到的所有层面。

✅ 期望回答

两个核心延迟指标:
  • TTFT (Time To First Token):用户提交请求到第一个token产生的时间
  • TPOT (Time Per Output Token):后续每个token的生成时间

优化方法(全栈): 硬件层:
  • 用最新GPU(H100 > A100);用高带宽内存(HBM3)
  • GPU互联:NVLink + NVSwitch

模型层:
  • 量化:FP16 -> INT4(GPTQ/AWQ)
  • 稀疏性:结构化/非结构化剪枝
  • 架构简化:用GQA替代MHA(KV Cache缩小,更快计算)
  • 模型蒸馏:用大模型蒸馏小模型

推理引擎层:
  • 高效KV Cache管理(PagedAttention + vLLM)
  • 算子融合(FlashAttention-2/3)
  • 量化KV Cache(KV Cache也用INT8/INT4存储)
  • CUDA Kernel优化(自定义算子 + Triton加速)

服务层:
  • Prompt缓存(高频System Prompt/Prefix缓存)
  • 并行策略(数据并行 = 多副本;模型并行 = 大模型分发)
  • 请求调度(短请求优先)
  • 流式输出(SSE/WebSocket发送token流)
#延迟优化#TTFT#TPOT