70

设计一个大模型推理服务的完整部署流程,从模型获取到上线监控。

模型部署与推理优化中等

📋 面试问题

设计一个大模型推理服务的完整部署流程,从模型获取到上线监控。

✅ 期望回答

完整部署流程: 1. 模型获取:
  • HuggingFace下载原始模型权重
  • 验证SHA256完整性

2. 模型转换:
  • 格式转换:SafeTensors -> 推理框架格式
  • 量化:FP16 -> INT4(GPTQ/AWQ)或 FP8
  • 框架适配:vLLM格式 或 TensorRT-LLM engine

3. 部署配置:
  • GPU配置:规格(A100/H100/H20)、数量、显存分配
  • 并发参数:max_num_seqs、max_model_len
  • 量化参数:dtype、quantization_method

4. 服务封装:
  • OpenAI兼容API(/v1/chat/completions)
  • 认证+限流(API Key + Rate Limiter)
  • 请求日志(保留用于后期分析)

5. 负载均衡:
  • 多卡推理:模型分片到多GPU
  • 多副本:同一模型多实例 + Nginx/HAProxy分发

6. 监控与运维:
  • 指标采集:QPS、延迟(P50/P95/P99)、GPU利用率、显存使用率、错误率
  • 告警:延迟超阈值 -> 自动扩容GPU;OOM -> 通知运维
  • 日志:推理日志 + 原始请求/响应采样存储
#部署流程#SRE#监控