32
什么是HyDE(Hypothetical Document Embeddings)?如何提升检索效果?
RAG检索增强生成中等
📋 面试问题
什么是HyDE(Hypothetical Document Embeddings)?如何提升检索效果?
✅ 期望回答
HyDE的核心思想:用户Query -> LLM生成一个假设性回答 -> 用假设性回答的Embedding去检索 -> 找到与「最理想答案(假设回答)」最相似的文档块
为什么有效:- 用户Query通常很短(「Transformer是什么」),而知识库文档内容丰富
- 短的Query Embedding与富内容的文档Embedding在向量空间中可能有差距
- 假设回答(由LLM生成,与知识库文档相似的内容)的Embedding更接近目标文档的Embedding分布
1. User Query: 「什么是RAG?」
2. LLM生成假设回答: 「RAG(检索增强生成)是一种结合信息检索和文本生成的技术...」
3. 用假设回答的Embedding做向量检索
4. 返回相关文档块
注意事项:- 延迟增加(多一次LLM调用),适用对延迟不敏感的离线/批量标注场景
- 假设回答可能包含幻觉,检索精度不一定100%提升,需测试验证
#HyDE#检索优化#Query改写