#上下文管理
共 2 篇文章
agent高级2026/08/13
Agent 的 Token 成本怎么控制:从计价模型到每请求成本管理的实战指南
Agent 单次请求动辄消耗数万 token,成本是普通 API 的数十倍。本文从 token 计价模型出发,拆解输入/输出/调用次数的成本构成,给出上下文瘦身、缓存复用、模型分层、批量与缓存折扣等可落地的成本控制手段与成本可观测体系。
rag进阶2026/08/09
RAG 的上下文窗口管理:检索到 20 个文档,但 LLM 只能吃下 5 个
Top-K 设得越大,LLM 的上下文窗口越不够用。本文从排序压缩、结构化过滤、渐进式阅读和上下文压缩四个维度,拆解在有限窗口内塞进更多有效信息的具体工程策略。