35

如何评估一个RAG系统的效果?设计一套完整的RAG评估方案。

RAG检索增强生成困难

📋 面试问题

如何评估一个RAG系统的效果?设计一套完整的RAG评估方案。

✅ 期望回答

三层评估架构: L1 - 检索质量:
  • Recall@k:检索的Top-K文档中,有多少比例能包含正确答案(k通常取3/5/10)
  • Precision@k:Top-K中真正相关的比例
  • MRR (Mean Reciprocal Rank):首个相关文档的排序倒数均值
  • NDCG@k:带排序权重的检索质量

L2 - 生成质量(RAGAS框架):
  • Faithfulness(忠实度):生成内容是否严格基于检索到的文档(非幻觉)
  • Answer Relevance(回答相关性):回答是否直接回应query
  • Context Relevance(上下文相关性):检索到的文档是否与query相关
  • Context Precision/Recall:检索的精确率和召回率

L3 - 端到端效果:
  • 人工评分(准确性、完整性、有用性)
  • LLM-as-Judge(GPT-4根据量化标准打分)
  • 用户行为指标(采纳率、点赞率、追问率)

实施:构建50-100条人工标注的(Query, Ground Truth)评估集,每次RAG改动跑一遍L1+L2+L3
#RAG评估#RAGAS#Recall