39

RAG系统的延迟如何优化?

RAG检索增强生成中等

📋 面试问题

RAG系统的延迟如何优化?

✅ 期望回答

RAG端到端延迟 = Embedding延迟 + 向量检索延迟 + Reranker延迟 + LLM生成延迟

优化策略:
  • Embedding加速:用ONNX加速推理或量化Embedding模型(INT8);批量处理多个Query并行编码
  • 检索加速:向量数据库选择高性能引擎(Milvus/Qdrant Rust版);使用IVF/HNSW索引而非暴力搜索(牺牲少量精度换速度);预热索引到内存
  • Reranker优化:不一定要Reranker(简单场景可省略);用更轻量Reranker(如BAAI bge-reranker-v2-m3)
  • LLM加速:vLLM + TensorRT-LLM + INT4量化 + Continuous Batching;流式输出(SSE/WebSocket)改善首字体验
  • 并行/批量:将Embedding和LLM生成放置在独立的GPU上(减少资源争抢);批量处理可并行的步骤
#延迟优化#加速#性能