别再吹Agent「很强」了:一套可落地的AI Agent评测基准搭建指南
大多数团队评测Agent靠感觉,上线后翻车。本文给出一套从任务集设计、评分维度到自动化回归的完整评测方法,附可复用的指标框架。
一个残酷现实:你的Agent可能”看起来能用”
Demo里Agent行云流水,上线后用户投诉”答非所问""调错工具""绕圈”。根本原因往往不是模型不行,而是团队从没认真评测过。本文给出一套不依赖大厂工具、小团队也能落地的评测方法。
第一步:把”模糊需求”变成”任务集”
评测始于任务集(Test Set)。不要凭空造,来源优先级:
- 真实用户日志:收集线上真实提问,最有代表性
- 失败案例库:把历史翻车案例整理成回归任务
- 边界与对抗样本:空输入、超长输入、恶意指令、歧义问题
每个任务要写清:输入、期望结果、评判标准。建议起步50条,覆盖核心场景各10条以上。
第二步:分层评分,别只看”对不对”
Agent比单轮问答复杂,评分要分三层:
| 层级 | 评什么 | 怎么评 |
|---|---|---|
| 结果层 | 最终答案是否正确 | 人工标注或LLM评分 |
| 过程层 | 工具调用是否合理 | 检查调用序列、参数 |
| 效率层 | 步数/成本/延迟 | 自动统计 |
只看结果层会漏掉”蒙对的答案”——过程错但恰好结果对,上线必翻车。
第三步:LLM-as-Judge的正确用法
用大模型当裁判能省人力,但要用对:
- 给评分标准:明确写出评分维度和分数定义
- 给参考示例:附1-2个满分和0分样本锚定标准
- 要求解释理由:让裁判先说理由再给分,降低随意性
- 定期人工抽检:校准裁判,防止”越评越飘”
切忌直接问”这个回答好不好”——无锚点的评分几乎无效。
第四步:建立自动化回归流水线
评测不是一次性的,要像跑测试一样常态化:
- 每次改动跑一遍:提示词、模型、工具任何变更都触发评测
- 设置通过率门槛:低于阈值禁止上线
- 记录历史曲线:看指标是升是降,而不是单看绝对值
- 新增失败案例:线上每出一次错,就固化进任务集
这就是Agent版的”回归测试”,是稳定性的命根子。
关键指标清单
- 任务成功率:核心北极星指标
- 工具调用准确率:调用对工具、用对参数的比例
- 平均步数:步数越多越不可控、越贵
- 幻觉率:无依据断言的比例
- 成本/延迟:P95延迟和单任务成本
常见误区
- 指标堆砌却不行动:评测要驱动决策,否则是表演
- 只用公开基准:公开榜单和你的业务场景往往不相关
- 评测集从不更新:业务变了,老任务集就失效
- 裁判不校准:LLM裁判会漂移,必须人工抽检
落地节奏建议
第一周:攒50条真实任务,跑人工基线。 第二周:接入LLM裁判,建立自动评分。 第三周:接入CI,实现改动即评测。 之后:每周补充失败案例,持续维护。
一句话总结
**Agent的”强”不是感觉出来的,是评测出来的。**先把任务集、分层评分、自动回归这三件事做扎实,你的Agent才真正从玩具走向生产。