74
大模型上线后如何进行效果监控和自动告警?
模型部署与推理优化中等
📋 面试问题
大模型上线后如何进行效果监控和自动告警?
✅ 期望回答
监控维度:
服务指标(实时):
- QPS(每秒请求数)、延迟(TP50/TP95/TP99)、错误率(4xx/5xx)
- GPU利用率、显存使用率、排队深度
- 工具:Prometheus + Grafana + nvidia-smi Exporter
- 用户满意度(点赞/点踩/举报率)
- 会话深度(平均对话轮次)
- 转化/任务完成率
- 每日采样数据 + LLM-as-Judge自动化评分
- 监控输出多样性崩溃(所有回答趋于一致模板化)
- 监控安全和安全合规(不安全内容占比)
- 延迟>阈值(TP99 > 3秒)-> 告警 -> 检查负载/GPU/推理引擎
- 错误率>2% -> 告警 -> 检查模型/依赖/配置
- 满意度暴跌(日环比下降>10%)-> 告警 -> 检查最近部署/Prompt变更
- 哈希匹配检测恶意Prompt Injection
#监控#告警#运维