34

如何处理多模态文档的RAG(图片中的文字、表格等)?

RAG检索增强生成困难

📋 面试问题

如何处理多模态文档的RAG(图片中的文字、表格等)?

✅ 期望回答

多模态RAG需要处理包含文本、图片、表格、公式等多元内容的文档

处理策略:
  • 图片中的文字:OCR提取(Tesseract、PaddleOCR) -> 转为文本 -> 嵌入;或直接使用多模态Embedding(CLIP)
  • 表格:
- 保留表格原始Markdown/HTML格式 -> 模型能理解表格结构

- 用Table Transformer提取表格并转为结构化JSON -> 存入向量库(用文本描述+行列索引)

  • 图表信息:
- 多模态LLM(GPT-4V/Gemini/Qwen-VL)摘要图表内容 -> 文本嵌入

- 保留原始图片URL -> 检索阶段返回图片链接

  • PDF中复杂布局:用Unstructured.io、LlamaParse等工具提取,保留层级结构和原始格式

技术栈推荐:
  • 文档解析:Unstructured.io / LlamaParse / Marker
  • 多模态Embedding:CLIP / Jina CLIP
  • 图表理解:GPT-4V / Qwen-VL
#多模态RAG#OCR#文档解析