70
设计一个大模型推理服务的完整部署流程,从模型获取到上线监控。
模型部署与推理优化中等
📋 面试问题
设计一个大模型推理服务的完整部署流程,从模型获取到上线监控。
✅ 期望回答
完整部署流程:
1. 模型获取:
- HuggingFace下载原始模型权重
- 验证SHA256完整性
- 格式转换:SafeTensors -> 推理框架格式
- 量化:FP16 -> INT4(GPTQ/AWQ)或 FP8
- 框架适配:vLLM格式 或 TensorRT-LLM engine
- GPU配置:规格(A100/H100/H20)、数量、显存分配
- 并发参数:max_num_seqs、max_model_len
- 量化参数:dtype、quantization_method
- OpenAI兼容API(/v1/chat/completions)
- 认证+限流(API Key + Rate Limiter)
- 请求日志(保留用于后期分析)
- 多卡推理:模型分片到多GPU
- 多副本:同一模型多实例 + Nginx/HAProxy分发
- 指标采集:QPS、延迟(P50/P95/P99)、GPU利用率、显存使用率、错误率
- 告警:延迟超阈值 -> 自动扩容GPU;OOM -> 通知运维
- 日志:推理日志 + 原始请求/响应采样存储
#部署流程#SRE#监控