#Agent
共 10 篇文章
企业级 Agent 安全防御:从「单层 Prompt」到「四层防守漏斗」的架构演进
当大模型从「聊天机器人」走向「企业级 Agent」,安全不再是「写一个好的 System Prompt」就能解决的事情。本文结合企业级实践,拆解 Agent 多级防御架构的设计思路与落地方法——从静态规则、LLM 语义审核、工具权限管控到输出审核的四层防守漏斗。
Agent 的 Token 成本怎么控制:从计价模型到每请求成本管理的实战指南
Agent 单次请求动辄消耗数万 token,成本是普通 API 的数十倍。本文从 token 计价模型出发,拆解输入/输出/调用次数的成本构成,给出上下文瘦身、缓存复用、模型分层、批量与缓存折扣等可落地的成本控制手段与成本可观测体系。
模型输出不稳定怎么兜底:从容错解析到降级链路的系统工程
LLM 输出的不确定性是 Agent 工程的常态:格式漂移、字段丢失、工具参数错误随时可能发生。本文给出完整的兜底架构——结构化输出、容错解析、校验重试、降级链路与版本回滚,让系统在模型「任性」时依然稳定交付。
Agent 跑到一半挂了,怎么断点续跑?——从一次面试翻车说起
从一次面试翻车出发,系统拆解 Agent 断点续跑的三个层次(任务级/步骤级/调用级),以及幂等性与崩溃一致性这两个关键地基,附完整工程实践。
Agent 如何降低幻觉:从检索接地到事实验证的系统工程
Agent 的幻觉来源比单次 LLM 生成更复杂:上下文缺口、工具错误、多步累积都会放大错误。本文系统拆解 Agent 幻觉的四大来源,并给出检索接地、结构化约束、自洽采样、事实验证 Agent 等可落地的抑制策略与评估方法。
Agent 如何实现低延迟响应:从 TTFT 到 Agent 循环的每一毫秒优化
Agent 的延迟不是单次 LLM 调用延迟,而是「多轮推理 + 工具调用 + 上下文组装」的链路延迟。本文拆解 Agent 延迟预算的构成,并从上下文瘦身、并行执行、流式输出、模型分层到缓存体系给出可落地的优化清单。
Agent 如何支撑 3 万 QPS:从单实例到分布式推理的工程全景
LLM Agent 的单次请求往往涉及多轮推理、工具调用与上下文组装,成本是普通接口的数十倍。本文从容量建模、推理服务、缓存体系、无状态架构到弹性伸缩,系统拆解 Agent 系统支撑 3 万 QPS 的完整工程路径。
Agent间冲突检测与协商机制:当多个Agent意见不一致时怎么办
在多Agent系统中,冲突不是异常而是常态。本文从检测、协商、回退三个层面,提供一套可落地的冲突治理方案,涵盖投票机制、加权投票、仲裁Agent设计、动态优先级矩阵及安全回退策略。
Agent间通信协议设计:为什么你的Multi-Agent系统需要一套对话规范
从消息格式、通信模式、路由策略、错误处理到外部交互,五层递进拆解 Agent 间通信协议(IACP)的设计范式,让你的 Multi-Agent 系统从"能跑"迈向"可扩展、可插拔"。