35
如何评估一个RAG系统的效果?设计一套完整的RAG评估方案。
RAG检索增强生成困难
📋 面试问题
如何评估一个RAG系统的效果?设计一套完整的RAG评估方案。
✅ 期望回答
三层评估架构:
L1 - 检索质量:
- Recall@k:检索的Top-K文档中,有多少比例能包含正确答案(k通常取3/5/10)
- Precision@k:Top-K中真正相关的比例
- MRR (Mean Reciprocal Rank):首个相关文档的排序倒数均值
- NDCG@k:带排序权重的检索质量
- Faithfulness(忠实度):生成内容是否严格基于检索到的文档(非幻觉)
- Answer Relevance(回答相关性):回答是否直接回应query
- Context Relevance(上下文相关性):检索到的文档是否与query相关
- Context Precision/Recall:检索的精确率和召回率
- 人工评分(准确性、完整性、有用性)
- LLM-as-Judge(GPT-4根据量化标准打分)
- 用户行为指标(采纳率、点赞率、追问率)
#RAG评估#RAGAS#Recall