39
RAG系统的延迟如何优化?
RAG检索增强生成中等
📋 面试问题
RAG系统的延迟如何优化?
✅ 期望回答
RAG端到端延迟 = Embedding延迟 + 向量检索延迟 + Reranker延迟 + LLM生成延迟
优化策略:- Embedding加速:用ONNX加速推理或量化Embedding模型(INT8);批量处理多个Query并行编码
- 检索加速:向量数据库选择高性能引擎(Milvus/Qdrant Rust版);使用IVF/HNSW索引而非暴力搜索(牺牲少量精度换速度);预热索引到内存
- Reranker优化:不一定要Reranker(简单场景可省略);用更轻量Reranker(如BAAI bge-reranker-v2-m3)
- LLM加速:vLLM + TensorRT-LLM + INT4量化 + Continuous Batching;流式输出(SSE/WebSocket)改善首字体验
- 并行/批量:将Embedding和LLM生成放置在独立的GPU上(减少资源争抢);批量处理可并行的步骤
#延迟优化#加速#性能