共 1 篇文章
Agent 的延迟不是单次 LLM 调用延迟,而是「多轮推理 + 工具调用 + 上下文组装」的链路延迟。本文拆解 Agent 延迟预算的构成,并从上下文瘦身、并行执行、流式输出、模型分层到缓存体系给出可落地的优化清单。