74

大模型上线后如何进行效果监控和自动告警?

模型部署与推理优化中等

📋 面试问题

大模型上线后如何进行效果监控和自动告警?

✅ 期望回答

监控维度: 服务指标(实时):
  • QPS(每秒请求数)、延迟(TP50/TP95/TP99)、错误率(4xx/5xx)
  • GPU利用率、显存使用率、排队深度
  • 工具:Prometheus + Grafana + nvidia-smi Exporter

业务指标(离线/准实时):
  • 用户满意度(点赞/点踩/举报率)
  • 会话深度(平均对话轮次)
  • 转化/任务完成率

模型质量指标(离线):
  • 每日采样数据 + LLM-as-Judge自动化评分
  • 监控输出多样性崩溃(所有回答趋于一致模板化)
  • 监控安全和安全合规(不安全内容占比)

自动告警策略:
  • 延迟>阈值(TP99 > 3秒)-> 告警 -> 检查负载/GPU/推理引擎
  • 错误率>2% -> 告警 -> 检查模型/依赖/配置
  • 满意度暴跌(日环比下降>10%)-> 告警 -> 检查最近部署/Prompt变更
  • 哈希匹配检测恶意Prompt Injection
#监控#告警#运维