AI Agent评测:为什么跑分高不等于好用
拆解Agent评测的常见陷阱,讲清离线基准、在线评测、人工评估怎么配合,附一套可落地的评测体系。
跑分漂亮,上线翻车
很多团队都遇到过:Agent 在纸面基准上得分很高,一上线用户就骂。为什么?
因为基准测的是”能不能做对一次”,而生产测的是”能不能稳定地做对,还不闯祸”。 这两件事差得很远。
Agent评测和普通模型评测有什么不同
普通模型评测:输入 → 输出 → 比对答案。相对简单。
Agent 评测难得多:
- 多步执行:一次任务是十几次工具调用,错一步全盘皆输
- 有副作用:Agent 会改文件、发邮件、下单,做错代价真实
- 路径不唯一:达成目标的路径很多,不能只比”标准答案”
- 环境依赖:结果依赖外部工具和数据的当前状态
- 长尾:真实任务的分布和测试集差得远
所以 Agent 评测必须用多套方法组合。
三层评测体系
第一层:离线基准(快、可重复)
用固定任务集跑回归,看有没有退化。
- 任务级成功率:完整任务是否达成目标
- 步骤效率:用了几步,有没有绕远路
- 工具调用正确率:选对工具了吗,参数对吗
关键是每次改动都跑一遍,防止”修好一个坏了三个”。
第二层:在线评测(真实环境)
离线永远测不出真实分布。上线后要:
- 影子模式:新版本和旧版本同时跑,对比结果不对外
- 灰度发布:小流量试,观察成功率、延迟、成本
- 真实反馈采集:用户点赞/投诉/重试都是信号
第三层:人工评估(质量的金标准)
自动指标测不出”这个回答是不是真的有用”。
- 定期抽样人工打分
- 重点看高风险场景:涉及钱、合规、对外沟通的
- 建立标注规范,保证多人评分一致
不要迷信自动指标,高风险场景必须有人把关。
关键指标
| 指标 | 含义 | 关注点 |
|---|---|---|
| 任务成功率 | 完整达成目标的比例 | 核心 |
| 步骤/工具效率 | 完成任务的代价 | 成本与体验 |
| 副作用率 | 误操作/越权比例 | 安全 |
| 一致性 | 同样输入结果是否稳定 | 可靠性 |
| 平均延迟 | 端到端耗时 | 体验 |
| 单任务成本 | token + 工具调用花费 | 商业可行性 |
评测集怎么设计
- 覆盖真实分布:从生产日志里采样,别拍脑袋编
- 包含边界和对抗:模糊指令、恶意注入、缺数据
- 分层:简单/中等/困难,看各层表现
- 持续更新:产品变了,评测集也要变
- 可复现:固定环境快照,避免”这次跑成功下次失败”说不清
常见的评测陷阱
- 只测成功率不测副作用:Agent 把事办成了,但顺手删了数据
- 测试集和训练/调优集重叠:分数虚高,一上真实场景就露馅
- 步数不设上限:Agent 绕了一百步才成功,也算”成功”?成本早爆了
- 忽视一致性:同输入跑三次结果全不同,用户根本没法信任
- 没有回归测试:改了个提示词,悄悄打崩了别的场景
落地清单
- 建离线回归集,每次改动都跑
- 指标覆盖成功率、成本、延迟、副作用
- 上线走灰度 + 影子对比
- 关键场景保留人工评估
- 评测集从真实日志采样并持续更新
- 记录每次改动的分数变化,防退化
结语
Agent 评测的难点不在”跑分”,而在”可信”。 一个 Agent 好不好,要看它在真实分布下能不能稳定、安全、经济地完成任务。把离线回归、在线验证、人工评估三层结合起来,你才能对着仪表盘而不是拍脑袋做决策。