32

什么是HyDE(Hypothetical Document Embeddings)?如何提升检索效果?

RAG检索增强生成中等

📋 面试问题

什么是HyDE(Hypothetical Document Embeddings)?如何提升检索效果?

✅ 期望回答

HyDE的核心思想:用户Query -> LLM生成一个假设性回答 -> 用假设性回答的Embedding去检索 -> 找到与「最理想答案(假设回答)」最相似的文档块

为什么有效:
  • 用户Query通常很短(「Transformer是什么」),而知识库文档内容丰富
  • 短的Query Embedding与富内容的文档Embedding在向量空间中可能有差距
  • 假设回答(由LLM生成,与知识库文档相似的内容)的Embedding更接近目标文档的Embedding分布

流程:

1. User Query: 「什么是RAG?」

2. LLM生成假设回答: 「RAG(检索增强生成)是一种结合信息检索和文本生成的技术...」

3. 用假设回答的Embedding做向量检索

4. 返回相关文档块

注意事项:
  • 延迟增加(多一次LLM调用),适用对延迟不敏感的离线/批量标注场景
  • 假设回答可能包含幻觉,检索精度不一定100%提升,需测试验证
#HyDE#检索优化#Query改写