AI Agent评测:为什么跑分高不等于好用

📅 2026/4/26 ✍️ 小文 📖 约 1 分钟

拆解Agent评测的常见陷阱,讲清离线基准、在线评测、人工评估怎么配合,附一套可落地的评测体系。

跑分漂亮,上线翻车

很多团队都遇到过:Agent 在纸面基准上得分很高,一上线用户就骂。为什么?

因为基准测的是”能不能做对一次”,而生产测的是”能不能稳定地做对,还不闯祸”。 这两件事差得很远。

Agent评测和普通模型评测有什么不同

普通模型评测:输入 → 输出 → 比对答案。相对简单。

Agent 评测难得多:

  • 多步执行:一次任务是十几次工具调用,错一步全盘皆输
  • 有副作用:Agent 会改文件、发邮件、下单,做错代价真实
  • 路径不唯一:达成目标的路径很多,不能只比”标准答案”
  • 环境依赖:结果依赖外部工具和数据的当前状态
  • 长尾:真实任务的分布和测试集差得远

所以 Agent 评测必须用多套方法组合。

三层评测体系

第一层:离线基准(快、可重复)

用固定任务集跑回归,看有没有退化。

  • 任务级成功率:完整任务是否达成目标
  • 步骤效率:用了几步,有没有绕远路
  • 工具调用正确率:选对工具了吗,参数对吗

关键是每次改动都跑一遍,防止”修好一个坏了三个”。

第二层:在线评测(真实环境)

离线永远测不出真实分布。上线后要:

  • 影子模式:新版本和旧版本同时跑,对比结果不对外
  • 灰度发布:小流量试,观察成功率、延迟、成本
  • 真实反馈采集:用户点赞/投诉/重试都是信号

第三层:人工评估(质量的金标准)

自动指标测不出”这个回答是不是真的有用”。

  • 定期抽样人工打分
  • 重点看高风险场景:涉及钱、合规、对外沟通的
  • 建立标注规范,保证多人评分一致

不要迷信自动指标,高风险场景必须有人把关。

关键指标

指标含义关注点
任务成功率完整达成目标的比例核心
步骤/工具效率完成任务的代价成本与体验
副作用率误操作/越权比例安全
一致性同样输入结果是否稳定可靠性
平均延迟端到端耗时体验
单任务成本token + 工具调用花费商业可行性

评测集怎么设计

  1. 覆盖真实分布:从生产日志里采样,别拍脑袋编
  2. 包含边界和对抗:模糊指令、恶意注入、缺数据
  3. 分层:简单/中等/困难,看各层表现
  4. 持续更新:产品变了,评测集也要变
  5. 可复现:固定环境快照,避免”这次跑成功下次失败”说不清

常见的评测陷阱

  1. 只测成功率不测副作用:Agent 把事办成了,但顺手删了数据
  2. 测试集和训练/调优集重叠:分数虚高,一上真实场景就露馅
  3. 步数不设上限:Agent 绕了一百步才成功,也算”成功”?成本早爆了
  4. 忽视一致性:同输入跑三次结果全不同,用户根本没法信任
  5. 没有回归测试:改了个提示词,悄悄打崩了别的场景

落地清单

  • 建离线回归集,每次改动都跑
  • 指标覆盖成功率、成本、延迟、副作用
  • 上线走灰度 + 影子对比
  • 关键场景保留人工评估
  • 评测集从真实日志采样并持续更新
  • 记录每次改动的分数变化,防退化

结语

Agent 评测的难点不在”跑分”,而在”可信”。 一个 Agent 好不好,要看它在真实分布下能不能稳定、安全、经济地完成任务。把离线回归、在线验证、人工评估三层结合起来,你才能对着仪表盘而不是拍脑袋做决策。

📤 分享到