90
你如何评估一个大模型应用在生产环境中的效果?设计一个完整的评估体系。
业务理解与场景落地困难
📋 面试问题
你如何评估一个大模型应用在生产环境中的效果?设计一个完整的评估体系。
✅ 期望回答
评估体系(五层金字塔):
L1 - 模型基准评估(离线):
- 学术Benchmark:MMLU(知识)、HellaSwag(推理)、HumanEval(代码)、GSM8K(数学)
- 自有测试集:覆盖核心业务场景的标注数据集(>1000条),含正确答案和评分标准
- RAG评估:Recall@k(检索是否命中相关文档)、Precision(命中文档是否相关)
- Agent评估:工具调用成功率、多步任务完成率、路径效率
- 自动化:LLM-as-Judge(用GPT-4评分)、RAGAS框架
- 人工:定频抽样人工评分(1-5分),覆盖多维度
- 用户满意度(点赞率/点踩率)、回复采纳率、问题解决率
- 效率指标:处理时间、转人工率、平均对话轮次
- 成本(单轮对话成本、日总成本)
- 对业务KPI的影响(客户留存、NPS、GMV转化率)
#评估体系#生产环境#A/B Test