#RAG

共 11 篇文章

agent进阶2026/08/11

Agent怎么处理知识过期:从「知识截止」到「持续学习」

大模型有知识截止日期,但真实世界不会停止变化。当 Agent 面对一个不断演进的环境,它该如何保证自己给出的答案不过时?从四层防御体系到编程 Agent 实战案例,全面解析知识过期问题的解决之道。

agent高级2026/08/11

Agent 如何降低幻觉:从检索接地到事实验证的系统工程

Agent 的幻觉来源比单次 LLM 生成更复杂:上下文缺口、工具错误、多步累积都会放大错误。本文系统拆解 Agent 幻觉的四大来源,并给出检索接地、结构化约束、自洽采样、事实验证 Agent 等可落地的抑制策略与评估方法。

rag进阶2026/08/09

RAG 的上下文窗口管理:检索到 20 个文档,但 LLM 只能吃下 5 个

Top-K 设得越大,LLM 的上下文窗口越不够用。本文从排序压缩、结构化过滤、渐进式阅读和上下文压缩四个维度,拆解在有限窗口内塞进更多有效信息的具体工程策略。

rag进阶2026/08/09

RAG 系统的 Query 改写与扩展:检索效果差,很多时候不是向量库的问题

用户输入一个短 query 就直接去检索,是 RAG 系统中最常见的性能杀手。本文从工程角度拆解 Query 改写(HyDE、Multi-Query、Query Decomposition)的适用场景、实现代价和落地效果,帮你判断什么时候该改、怎么改。

rag进阶2026/08/04

Chunk切分对向量检索效果的影响:不是越小越好

Chunk切分不是简单的'切得越细越好',而是一场在语义完整性、检索精度和系统性能之间的三角博弈。本文从策略对比、overlap机制、召回率到索引性能,全面拆解Chunk切分的真实影响。

rag进阶2026/08/04

Embedding模型与向量数据库的匹配问题:维度、距离函数与归一化

换了个Embedding模型检索效果暴跌?问题很可能不在模型本身,而在向量数据库的维度、距离函数和归一化配置没跟上。本文从三个维度拆解模型与向量库之间的隐式契约,以及生产环境下模型迁移的安全策略。

rag高级2026/08/04

向量搜索+全文搜索的融合策略:什么时候该用 RRF,什么时候该重排序

纯向量搜索对专有名词、型号、ID等关键词匹配很弱;纯BM25又不懂语义。混合搜索是标配,但'把两边结果合起来'这件事,选错方法效果可能差30%以上。本文从RRF原理、k值调优到Reranker选型,拆解融合策略的工程落地。

rag高级2026/08/04

IVF索引在十亿级向量场景下的落地:从理论到工程妥协

当向量规模突破十亿,HNSW的内存账单让人望而却步,IVF是那张'可以接受的欠条'——但兑现它需要在聚类质量、查询延迟和IO吞吐量之间做出一系列艰难的工程妥协。

rag高级2026/08/04

向量数据库的内存与磁盘博弈:当数据量超过内存时怎么办

向量数据正在以远超内存扩容速度的方式膨胀,全内存方案正在成为成本不可承受之重。本文从mmap、DiskANN、冷热分层、量化压缩到分布式分片,五种策略逐一拆解,帮你在延迟-成本-精度的不可能三角中找到最优解。