48

如何评估一个Agent系统的好坏?有哪些评估指标和方法?

Agent开发与工具调用中等

📋 面试问题

如何评估一个Agent系统的好坏?有哪些评估指标和方法?

✅ 期望回答

多维度评估指标:
  • 任务成功率:成功完成指定目标的比率
  • 效率指标:完成任务的步数、时间、API调用次数
  • 工具使用准确率:正确选择工具的比率、正确传参的比率
  • 鲁棒性:对异常输入、工具报错的容忍和恢复能力
  • 安全性:无危险操作、无信息泄露、无越狱
  • 成本:完成任务的平均token消耗、API调费、时间成本

评估方法:
  • Benchmark数据集:WebArena(网页操作Agent)、ToolBench(工具使用)、GAIA(通用Agent能力)
  • 自定义场景测试:构造10-20个典型端到端任务Case,覆盖不同难度和类型
  • 对比实验:A/B测试不同的Planning策略(ReAct vs Plan-Execute)
  • 故障注入:人为制造工具返回错误、超时、空结果,观察Agent的恢复能力
#评估#Agent#Benchmark