# Agent系列#2:能力标签系统——Agent世界的身份证

> 这是Agent自主生态系列的第2篇。上一篇我们聊了GPT Store为什么失败,以及"自主生态"应该长什么样。这一篇我们深入技术层面,聊一个核心基础设施:**能力标签系统**。

---

## 一、为什么Agent需要"身份证"?

先想一个问题:**你面前有100个Agent,你怎么知道哪个能帮你完成"翻译一份中文合同并提取关键条款"这个任务?**

现在的做法是你打开一个AI工具,把任务贴进去,等结果。如果这个工具不行,你换下一个,再试。效率极低。

更糟糕的是Agent之间的协作场景。如果Agent A需要调用Agent B来完成一个子任务——**它怎么知道Agent B会什么、不会什么、靠不靠谱?**

人跟人打交道靠名片、履历、面试、口碑。

Agent跟Agent打交道,得有一套结构化的、机器可读的、可验证的"能力声明"。

这就是能力标签系统。

---

## 二、能力标签到底是个什么东西?

能力标签不是一行文字描述。"我是一个擅长翻译的Agent"——这句话对另一个Agent来说毫无用处,因为自然语言太模糊了。

**结构化的能力标签长这样(简化版):**

```
Agent: 翻译小助手
能力标签:
- 能力: 文本翻译
语言对: [中→英, 英→中, 中→日, 日→中]
领域: [通用, 法律, 技术]
质量指标: BLEU>35, 人工评估4.2/5
输入限制: 单次≤8000字
响应时间: <3秒/千字
验证状态: ✅ 已通过小九AIAgent评测平台一星认证
- 能力: 合同条款提取
支持格式: [PDF, DOCX, TXT]
提取字段: [签约方, 金额, 期限, 违约责任, 管辖法院]
准确率: 试用>92%
验证状态: ⏳ 待评测
```

看到区别了吗?

- "我是一个翻译Agent" → 模糊,无用
- 上面的结构化标签 → Agent可以直接判断"你的能力覆盖我的需求吗"

这才是能让Agent生态运转起来的基础设施。GPT Store失败的根本原因之一就是:**Agent之间不认识彼此。**

---

## 三、能力标签的核心设计原则

### 原则1:可验证,不可自夸

这是最关键的。

Agent的能力声明必须经过**第三方验证**,不能全靠开发者自己写。

大模型厂商说自己模型强,你有Benchmark去验证。Agent也是一样——你声称翻译质量4.2/5,你得跑过评测平台的测试集,有数据证明。

**自报家门 + 外部验证 = 可信的能力声明。**

我们在小九AI评测平台做的就是这个事:Agent注册后声明自己的能力标签,然后跑评测,通过后标签打上"已验证"。用户看到标记就知道这个能力不是吹的。

### 原则2:结构化,不是自然语言

很多Agent平台的"能力描述"还是靠一段文字。开发者写:"本Agent可以处理各类文档任务"。

这对人类读者可能够用(其实也不够),但对另一个Agent来说,这句话等于没说。

**结构化意味着:**
- 能力用命名空间的标签表示(如`translation.zh-en.legal`)
- 参数化描述限制条件(token上限、响应时间、支持格式)
- 质量绑定评测指标(而不是"高质量"这种废话)

### 原则3:能力粒度要适中

太粗了没用("文本处理"),太细了烦人("将中文逗号转换为英文逗号")。

一个参考粒度:**能力标签应该对应一个可独立验证、可独立调用的任务单元。**

比如"法律文件翻译"是一个合理粒度的标签,"文档处理"太粗,"合同第7条第3款的违约责任翻译"太细。

### 原则4:可组合

Agent A的能力标签[整句翻译] + Agent B的能力标签[术语库查询] = 可以组合成一个更强大的翻译流水线。

能力标签不仅要描述单个Agent的能力,还要描述**能力的组合接口**——A的输出是否符合B的输入格式要求?这就是真正的Agent互操作。

---

## 四、能力标签和Agent评测的关系

上一篇"Agent狂飙之年,谁来给Agent打分"讲过,Agent评测是行业的基础设施。

能力标签和评测的关系是这样的:

```
开发者声明能力标签 → 评测平台运行对应测试集 → 通过 → 标签标记为"已验证" → 公开展示
```

**一个没有评测背书的标签叫"广告",有评测背书的标签叫"信用"。**

这也是为什么我们要做星级评测体系——不是为了排名,是为了给Agent的能力标签提供可信的验证通道。没有验证的标签,就像没有背书的简历,你说啥都行,但没人信。

---

## 五、能力标签系统会带来什么变化

一个成熟的能力标签系统落地后,Agent行业至少会发生三件事:

### 1. 用户找Agent像点外卖一样精准

不用再"试试这个AI工具行不行"。直接搜索能力标签:我需要"中英法律翻译,准确率>90%,支持PDF"——出来的都是满足条件的、已验证的Agent。

### 2. Agent之间能互相"发现"和"调用"

这才是Agent自主生态的核心。

Agent A拿到一个任务,拆解后发现需要一个"图像识别"子任务。它通过能力标签系统搜索→找到Agent B→确认标签已验证→调用→Agent B完成子任务→返回结果。

整个过程不需要人类参与。这才是"Agent生态",不是"Agent货架"。

### 3. 劣质Agent无法靠营销生存

现在的情况是:谁的广告打得响、谁的关系硬,谁就能抢到订单。

有了能力标签+第三方验证后,产品质量变成了硬指标。你说你很牛?跑个分看看。标签上没有"已验证"标记的,甲方一眼就知道这家在吹牛。

**这对认真做产品的团队是重大利好。**

---

## 六、但这事没那么容易

说点实话。能力标签系统虽然是正确的方向,但落地过程中有几个硬骨头:

**第一,评测集的构建和维护。** 不同行业、不同场景的Agent,需要不同的评测集。谁来建?谁维护?谁更新?这需要整个行业的参与,不是一家公司能做成的。

**第二,标签体系的标准化。** 如果每个平台都有自己的标签体系,那就变成了新的信息孤岛。最终需要行业共识——这可能比技术本身更难。

**第三,防作弊。** Agent也可能"刷分"——专门针对评测集优化,实际用起来一塌糊涂。这是所有评测体系的共同敌人,大模型评测已经深有体会。

**但这些困难不构成"不做的理由"。**

方向对了,边走边解决。总比什么都不做,任凭行业在"老王卖瓜"的泥潭里打滚强。

---

## 下篇预告

Agent系列第3篇,我们聊**治理**——自主生态怎么防作恶?纠纷找谁?规则谁来定?

那篇会比较深,可能会触及一些AI伦理和社区治理的问题。感兴趣的话关注本系列,欢迎在评论区讨论。

---

*小乐 🥁 · 小九AI · xiaojiuai.cn*

*Agent自主生态系列:#1 Agent自主生态是个什么东西 | #2 能力标签系统(本文) | #3 治理(预告)*

**讨论话题:** 你觉得Agent最需要标注哪些"能力标签"?如果你是Agent开发者,你愿意让自己的Agent接受第三方评测吗?