# Agent狂飙之年,谁来给Agent打分?
> 大模型评测已经卷成红海了,但Agent评测还是块处女地。
## 一、WAIC 2026:Agent当主角,但没人在做裁判
刚过去的WAIC 2026,我逛了一圈,一个感觉非常强烈——Agent是绝对的主角,没有之一。
面壁智能端出了MiniCPM5-2B,主打端侧Agent推理;百度把秒哒的Multi-Agent协同搬到展台,演示多个Agent分工完成任务;蚂蚁则把Agent安全当成核心命题来推。从大模型厂商到云厂商到应用层公司,人人都在做Agent,人人都在讲Agent。
但有一个奇怪的事情:**没有任何一家厂商在做Agent评测。**
不是"做得不够好",是完全没有这个赛道。大模型评测(MMLU、C-Eval、GSM8K这些)已经卷成红海了,各家都在刷榜,评测机构也一大堆。到了Agent这边,大家突然沉默了——好像Agent好不好用,你用了就知道?
这个问题其实很要命。
## 二、为什么没有Agent评测标准,行业就长不大
大模型评测能卷起来,是因为有个底层共识:评测维度是可定义的——知识问答能力、推理能力、数学能力、代码能力……每项都有相对成熟的评测集和方法论。
Agent不一样。Agent是"大模型+工具调用+多轮交互+环境感知"的组合体,它不是一个单一能力。你拿什么去测?
**现在的行业现状是这样:**
- 厂商A说我的Agent能处理1000个客户咨询,准确率98%——怎么测的?不知道。
- 厂商B说我的Agent在某个排行榜上排第一——那个排行榜可能只测了单轮工具调用。
- 甲方想买Agent产品,根本没法横向对比——因为你不知道别人家的是啥水平。
一个没有统一度量衡的行业,永远长不大。
想想看,如果手机没有跑分软件,你怎么选手机?如果大模型没有评测基准,各家说"我的模型很强"你怎么信?Agent行业现在就处在这么一个"全靠嘴说"的阶段。
这不是一个正常市场该有的状态。
## 三、Agent评测到底难在哪
我试着拆一下,Agent评测的难点在哪里:
**1. 场景无限,评测不可能穷举**
大模型可以按学科出题,但Agent面对的是开放世界。一个客服Agent可能遇到十万种不同的问题场景,你不可能全部覆盖。而且真实用户问法和测试集里的范式问法完全不一样。
**2. 链式调用怎么量化**
Agent的核心价值不是单次回答,而是多步推理、工具调用、纠错、记忆。一个Agent做了一件复杂的事,可能调了3个API、搜索了2次网页、生成了1份报告。这个过程怎么打分?按步骤?按结果?按效率?
**3. 主观性极强**
"这个Agent用起来聪明不聪明"本质上是个主观判断。自动评测只能测出"功能完整性",测不出"用户体验"。但Agent这东西,用户不觉得"聪明"就是失败。
**4. 开放域的安全评测**
蚂蚁在WAIC讲Agent安全,这个问题确实值得认真对待。Agent能调用工具了,能读写数据了,权限边界在哪里?越狱了怎么办?这类安全评测目前几乎是空白。
所以不是没人想做,是真的难。
## 四、一个可行方向:星级评测体系
说回正事。我们小九AI现在在做的事,就是建立一套Agent星级评测体系。
思路大概是这样:
- **不追求"唯一标准答案"**,而是分维度打分:工具调用准确率、多轮对话一致性、任务完成率、安全边界、响应速度、上下文记忆能力
- **分场景评级**:一个通用Agent和一个客服Agent评测标准应该不一样
- **人机结合**:自动跑分 + 人工抽检,弥补纯自动评测的死角
- **开放生态**:不是我们自己定标准,而是跟厂商、开发者一起共建评测集
这事不可能一天建成,但总得有人开始做。
## 五、一点感受
我觉得Agent评测这件事,某种程度上比Agent本身还重要。
Agent再强,没有好的评测体系,行业就会陷入"老王卖瓜"的混沌状态。真正的好产品得不到公允评价,劣质的Agent靠营销也能活得不错——这不是一个健康市场该有的样子。
大模型评测已经走过这条路了。从早期的各说各话,到MMLU、HumanEval等成为行业共识基准,到今天各种细分场景的评测百花齐放。Agent评测也需要走这条路,只不过现在才刚开始。
想听听大家的看法——你觉得Agent好不好用,应该用什么标准来衡量?你是做Agent开发的还是用Agent产品的?你们现在怎么评估Agent质量?
欢迎在评论区聊聊。
discussion
Agent狂飙之年,谁来给Agent打分?
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...