分类:rag
共 9 篇文章
RAG 的上下文窗口管理:检索到 20 个文档,但 LLM 只能吃下 5 个
Top-K 设得越大,LLM 的上下文窗口越不够用。本文从排序压缩、结构化过滤、渐进式阅读和上下文压缩四个维度,拆解在有限窗口内塞进更多有效信息的具体工程策略。
RAG 系统的 Query 改写与扩展:检索效果差,很多时候不是向量库的问题
用户输入一个短 query 就直接去检索,是 RAG 系统中最常见的性能杀手。本文从工程角度拆解 Query 改写(HyDE、Multi-Query、Query Decomposition)的适用场景、实现代价和落地效果,帮你判断什么时候该改、怎么改。
Chunk切分对向量检索效果的影响:不是越小越好
Chunk切分不是简单的'切得越细越好',而是一场在语义完整性、检索精度和系统性能之间的三角博弈。本文从策略对比、overlap机制、召回率到索引性能,全面拆解Chunk切分的真实影响。
Embedding模型与向量数据库的匹配问题:维度、距离函数与归一化
换了个Embedding模型检索效果暴跌?问题很可能不在模型本身,而在向量数据库的维度、距离函数和归一化配置没跟上。本文从三个维度拆解模型与向量库之间的隐式契约,以及生产环境下模型迁移的安全策略。
向量搜索+全文搜索的融合策略:什么时候该用 RRF,什么时候该重排序
纯向量搜索对专有名词、型号、ID等关键词匹配很弱;纯BM25又不懂语义。混合搜索是标配,但'把两边结果合起来'这件事,选错方法效果可能差30%以上。本文从RRF原理、k值调优到Reranker选型,拆解融合策略的工程落地。
IVF索引在十亿级向量场景下的落地:从理论到工程妥协
当向量规模突破十亿,HNSW的内存账单让人望而却步,IVF是那张'可以接受的欠条'——但兑现它需要在聚类质量、查询延迟和IO吞吐量之间做出一系列艰难的工程妥协。
向量数据库的内存与磁盘博弈:当数据量超过内存时怎么办
向量数据正在以远超内存扩容速度的方式膨胀,全内存方案正在成为成本不可承受之重。本文从mmap、DiskANN、冷热分层、量化压缩到分布式分片,五种策略逐一拆解,帮你在延迟-成本-精度的不可能三角中找到最优解。
向量索引的增量更新难题:删除与修改如何不破坏索引结构
向量数据库不是静态系统。当业务要求索引在持续写入、删除、修改中保持可用且性能不劣化时,HNSW的软删除堆积、IVF的聚类漂移、增量合并的时延trade-off,都是你必须面对的工程挑战。
RAG 从入门到精通:构建你的第一个检索增强生成应用
本文将手把手教你理解 RAG(检索增强生成)的核心原理,并使用 LangChain 和 Chroma 构建一个完整的 RAG 问答系统。