共 1 篇文章
Agent 单次请求动辄消耗数万 token,成本是普通 API 的数十倍。本文从 token 计价模型出发,拆解输入/输出/调用次数的成本构成,给出上下文瘦身、缓存复用、模型分层、批量与缓存折扣等可落地的成本控制手段与成本可观测体系。