共 2 篇文章
深入解析 LLM 上下文窗口、自注意力机制与 KV Cache 的工作原理,理解模型为什么会「忘事」、长文本为什么越用越贵,以及如何科学管理上下文预算。
LLM Agent 的单次请求往往涉及多轮推理、工具调用与上下文组装,成本是普通接口的数十倍。本文从容量建模、推理服务、缓存体系、无状态架构到弹性伸缩,系统拆解 Agent 系统支撑 3 万 QPS 的完整工程路径。