48
如何评估一个Agent系统的好坏?有哪些评估指标和方法?
Agent开发与工具调用中等
📋 面试问题
如何评估一个Agent系统的好坏?有哪些评估指标和方法?
✅ 期望回答
多维度评估指标:
- 任务成功率:成功完成指定目标的比率
- 效率指标:完成任务的步数、时间、API调用次数
- 工具使用准确率:正确选择工具的比率、正确传参的比率
- 鲁棒性:对异常输入、工具报错的容忍和恢复能力
- 安全性:无危险操作、无信息泄露、无越狱
- 成本:完成任务的平均token消耗、API调费、时间成本
- Benchmark数据集:WebArena(网页操作Agent)、ToolBench(工具使用)、GAIA(通用Agent能力)
- 自定义场景测试:构造10-20个典型端到端任务Case,覆盖不同难度和类型
- 对比实验:A/B测试不同的Planning策略(ReAct vs Plan-Execute)
- 故障注入:人为制造工具返回错误、超时、空结果,观察Agent的恢复能力
#评估#Agent#Benchmark