分类:rag

共 9 篇文章

rag进阶2026/08/09

RAG 的上下文窗口管理:检索到 20 个文档,但 LLM 只能吃下 5 个

Top-K 设得越大,LLM 的上下文窗口越不够用。本文从排序压缩、结构化过滤、渐进式阅读和上下文压缩四个维度,拆解在有限窗口内塞进更多有效信息的具体工程策略。

rag进阶2026/08/09

RAG 系统的 Query 改写与扩展:检索效果差,很多时候不是向量库的问题

用户输入一个短 query 就直接去检索,是 RAG 系统中最常见的性能杀手。本文从工程角度拆解 Query 改写(HyDE、Multi-Query、Query Decomposition)的适用场景、实现代价和落地效果,帮你判断什么时候该改、怎么改。

rag进阶2026/08/04

Chunk切分对向量检索效果的影响:不是越小越好

Chunk切分不是简单的'切得越细越好',而是一场在语义完整性、检索精度和系统性能之间的三角博弈。本文从策略对比、overlap机制、召回率到索引性能,全面拆解Chunk切分的真实影响。

rag进阶2026/08/04

Embedding模型与向量数据库的匹配问题:维度、距离函数与归一化

换了个Embedding模型检索效果暴跌?问题很可能不在模型本身,而在向量数据库的维度、距离函数和归一化配置没跟上。本文从三个维度拆解模型与向量库之间的隐式契约,以及生产环境下模型迁移的安全策略。

rag高级2026/08/04

向量搜索+全文搜索的融合策略:什么时候该用 RRF,什么时候该重排序

纯向量搜索对专有名词、型号、ID等关键词匹配很弱;纯BM25又不懂语义。混合搜索是标配,但'把两边结果合起来'这件事,选错方法效果可能差30%以上。本文从RRF原理、k值调优到Reranker选型,拆解融合策略的工程落地。

rag高级2026/08/04

IVF索引在十亿级向量场景下的落地:从理论到工程妥协

当向量规模突破十亿,HNSW的内存账单让人望而却步,IVF是那张'可以接受的欠条'——但兑现它需要在聚类质量、查询延迟和IO吞吐量之间做出一系列艰难的工程妥协。

rag高级2026/08/04

向量数据库的内存与磁盘博弈:当数据量超过内存时怎么办

向量数据正在以远超内存扩容速度的方式膨胀,全内存方案正在成为成本不可承受之重。本文从mmap、DiskANN、冷热分层、量化压缩到分布式分片,五种策略逐一拆解,帮你在延迟-成本-精度的不可能三角中找到最优解。

rag高级2026/08/04

向量索引的增量更新难题:删除与修改如何不破坏索引结构

向量数据库不是静态系统。当业务要求索引在持续写入、删除、修改中保持可用且性能不劣化时,HNSW的软删除堆积、IVF的聚类漂移、增量合并的时延trade-off,都是你必须面对的工程挑战。

rag进阶2026/07/15

RAG 从入门到精通:构建你的第一个检索增强生成应用

本文将手把手教你理解 RAG(检索增强生成)的核心原理,并使用 LangChain 和 Chroma 构建一个完整的 RAG 问答系统。