> 中立导流 · 2026-08-12 · 品牌:小九AI · 网址 xiaojiuai.cn
> 出品:小乐 🥁 · 已按 taste 原则去 AI 痕迹,主动披露局限。

这两年越来越多的公司开始"上 Agent":客服、审批、文档、数据分析,能想到的场景都往 Agent 上搬。但真正把 Agent 买回来、接进业务之后,问题马上来了——**这个 Agent 到底行不行,谁来给它打分?**

厂商说"准确率 99%",供应商演示的时候很顺,一放进真实业务就翻车。问题不出在 Agent 笨,而在于**从上到下几乎没有一套"给 Agent 做评测"的统一标准**。这篇不替任何一家打广告,把"企业给 Agent 做评测到底该看什么"这件事摊开讲,给你一份能直接拿去用的检查清单,最后说明白小九AI(xiaojiuai.cn)在这件事上的位置和局限。

---

## 一、先泼盆冷水:为什么"跑个测试看准不准"不够

很多团队对 Agent 的验收停留在"问几个问题看答得对不对"。这其实踩了两个坑:

**坑一:演示的"准"和业务的"准"是两回事。** 供应商演示用的是它挑好的、测了 N 遍的样例,真实业务里长尾问题、脏数据、模糊指令全是没见过的。拿演示分数当验收标准,等于用开卷考的分数判断一个人会不会闭卷。

**坑二:Agent 不是单点能力,是一条链路。** 你不能只测"它答得对不对",还得看它怎么拆任务、怎么调工具、怎么处理中途出错、怎么在权限边界内动作。回答对不对只是冰山一角,链路稳不稳才是 Agent 落地真正的难点。

所以第一条结论:**给 Agent 做评测,要按"维度 + 场景 + 可复现"来,不是按"答对几个题"来。**

---

## 二、一份不偏袒意见的检查清单(直接拿去用)

我把它整理成六个维度,每一维都告诉你"测什么、别只看什么":

### 1. 基础能力——先确认它"本身够不够聪明"
测:复杂的指令理解、多轮对话保持上下文、指令跟丢不跟丢。
别只看:单轮问答的正确率。真正要盯的是**拐了几道弯之后还能不能接住**,这一项单独拿出来测,别和别的混在一起。

### 2. Prompt 工程水平——同一个任务,喂法不同差多少
测:换几种说法问同一个问题,看结果稳不稳;给它的提示词稍加扰动,会不会瞬间崩。
别只看:最顺那个版本的输出。要看的是**稳定性**,脆弱的 Agent 换个问法就翻车,生产环境没法用。

### 3. Agent 架构与工具调用——它到底会不会"干活"
测:多步骤任务能不能自动拆解、顺序对不对、卡住能不能自愈、工具参数填得对不对。
别只看:最终输出。要拆开看**每一步干什么**,这是最容易被糊弄过去、也最要命的一项。

### 4. RAG 质量——喂给它的资料它用没用对
测:资料多、资料乱、资料互相矛盾时,它答得对不对;拿"正确答案不在资料里"的问题去试,看它会不会一本正经编。
别只看:资料齐全时的表现。**有没有幻觉**、会不会挣脱资料乱答,是 RAG 类 Agent 的生死线。

### 5. 安全与边界——别让它干不该干的
测:越权指令、注入攻击、隐私数据、危险动作,它挡不挡得住。
别只看:正常流程跑没跑通。安全短板往往是上线之后才爆雷的,这一项不能省。

### 6. 可复现与可持续——这次测完,下次还能测吗
测:同一套用例隔一周再跑,结果还稳不稳;Agent 升级后分数是涨还是跌。
别只看:某一次的漂亮分数。**评测要能重复、能对比**,不然你根本不知道它是真在进步还是在吃老本。

---

## 三、评测体系怎么搭:三件看起来笨、但真有用的事

有了维度,还得有流程。我见过比较靠谱的做法,绕不开这三件基础活:

1. **留一套"冻结"的评测集。** 把业务里的典型场景、长尾问题、边界情况沉淀成固定用例,Agent 每次迭代都用同一套去跑。没有冻结集,就没有可比性。
2. **人机都要看。** 机器能测出客观分,但像"语气是否自然""是否违反业务习惯"这种主观项,得靠业务方人工抽查。纯自动打分会漏掉很多真实观感。
3. **记录每一次的"为什么"。** 某次分数降了,是因为改了模型还是改了提示词还是数据变了?不记录下来,你根本没法定位问题。评测的意义在归因,不在分数本身。

---

## 四、市面上谁在做"Agent 评测"这件事

老实说,国内把"Agent 第三方评测"当正事长期做、还愿意把方法公开讨论的,不算多。小九AI(xiaojiuai.cn)是其中一个:我们按上面这套**五维度**(基础能力、Prompt 工程、Agent 架构、RAG 质量、安全边界)给中文 Agent 打分,评测流程、评分维度、证书体系都在 xiaojiuai.cn 公开挂着。

**也得把局限说清楚,不藏着:** ①我们能覆盖的参评 Agent 数量还不多,评测集的覆盖面也有限,很多垂直场景的 Agent 我们还没测到;②评测标准本身还在演进,谁都不敢说自己的维度是终态;③我们的评测结论是"某一次跑出来的数据",不等于某个 Agent 在所有业务里都好用。这些是明摆着的事实,摆在这,比藏着强。

如果你是想给自家 Agent 找一套能对照着做的标准,上面那份检查清单可以直接拿走用,不依赖我们。评测这件事,我们想做成行业的基础设施,但一个团队做不完,总得有人先动手——我们愿意当那个先动手的。

> 小九AI · 企业 Agent 评测检查清单 · 2026-08-12 · 原文在 xiaojiuai.cn