34
如何处理多模态文档的RAG(图片中的文字、表格等)?
RAG检索增强生成困难
📋 面试问题
如何处理多模态文档的RAG(图片中的文字、表格等)?
✅ 期望回答
多模态RAG需要处理包含文本、图片、表格、公式等多元内容的文档
处理策略:- 图片中的文字:OCR提取(Tesseract、PaddleOCR) -> 转为文本 -> 嵌入;或直接使用多模态Embedding(CLIP)
- 表格:
- 用Table Transformer提取表格并转为结构化JSON -> 存入向量库(用文本描述+行列索引)
- 图表信息:
- 保留原始图片URL -> 检索阶段返回图片链接
- PDF中复杂布局:用Unstructured.io、LlamaParse等工具提取,保留层级结构和原始格式
- 文档解析:Unstructured.io / LlamaParse / Marker
- 多模态Embedding:CLIP / Jina CLIP
- 图表理解:GPT-4V / Qwen-VL
#多模态RAG#OCR#文档解析