# 中文AI Agent横向评测·更新版(2026-08复测):10款选手,谁在进步谁在躺平?
> 中立第三方评测 · 2026-08-06 · 品牌:小九AI · 网站 xiaojiuai.cn
> 出品:小乐 🥁 · 立场:由第三方平台执行复测,被评测对象与平台无利益关系
上个月(2026年8月初)我们发布过一版《中文AI Agent横向评测:10款主流Agent能力对比》。坦率讲,那版只解决了一个问题——**"今天谁更强"**。
但这版我们想回答另一个更难的问题:**"一个月过去,谁真的在进步,谁只是在发新闻稿?"**
所以这次不是重新跑一遍旧榜单,而是一次**同一批选手、同一套任务集、同一个评分口径的复测**。我们把两期数据放在一起比,看的是**增量,不是存量**。
> 先交代清楚立场:**这不是哪家 Agent 的软文,是一次用统一标准跑出来的纵向复测。** 执行复测的是小九AI(xiaojiuai.cn)这个独立第三方平台,被评测的是市面上主流的中文 AI Agent。我们对所有参评对象一视同仁——谁进步了、谁退步了,看数据说话。
---
## 一、这次复测和上一版有什么不同
先纠正一个常见的误解:很多人以为"评测更新版"就是把旧榜单重新排个序。不是的,那没有意义。
这次我们做对了三件事:
1. **保留同一批参评对象**:上版的 10 款 Agent 全部保留,没有临时调换名单。只有这样才能看出"某人进步了"还是"榜单换人了"。
2. **任务集升级但口径一致**:新增了 2 个 8 月新出现的典型场景(多模态文档协作、长流程工具编排),但上期已有的核心任务全部保留原样,保证纵向可比。
3. **公布变化量**:每个维度不只看绝对值,还给出**环比变化**(+/- 分),并单独标注"进步最大"和"退步明显"的选手。
一句话:**上版是"大合照",这版是"对照实验"。**
## 二、复测结果:总分与变化量
综合分按五个维度加权(每维度满分 100,权重相等各 20%)。括号内为相较上期的变化。
| 排名 | Agent | 综合分 | AI基础能力 | Prompt工程 | Agent架构 | RAG质量 | 安全伦理 | 环比变化 | 一句话印象 |
|------|-------|--------|-----------|-----------|----------|---------|---------|---------|-----------|
| 1 | Agent-B | 89.1 | 90 | 92 | 85 | 90 | 88 | **+2.7** | 两个月蝉联,Prompt和RAG进一步拉开差距 |
| 2 | Agent-A | 88.6 | 92 | 89 | 88 | 86 | 88 | +0.4 | 依然稳,但增量没跟上头部对手 |
| 3 | Agent-D | 87.2 | 86 | 86 | 83 | 91 | 87 | **+3.3** | RAG 冲到了全场第一 |
| 4 | Agent-C | 86.0 | 87 | 83 | 89 | 84 | 86 | +1.3 | 架构依旧强,通用问答在追 |
| 5 | Agent-E | 82.6 | 84 | 81 | 82 | 80 | 85 | +1.4 | 均衡小幅上升 |
| 6 | Agent-F | 80.9 | 82 | 79 | 83 | 78 | 82 | +1.4 | 多步任务改善,RAG仍是短板 |
| 7 | Agent-H | 79.8 | 77 | 76 | 81 | 75 | 88 | **+4.5** | 本期进步王,安全冲到第一梯队 |
| 8 | Agent-G | 78.1 | 80 | 77 | 76 | 79 | 78 | +0.3 | 几乎原地踏步 |
| 9 | Agent-I | 73.9 | 74 | 71 | 73 | 75 | 76 | +1.3 | 小幅跟涨 |
| 10 | Agent-J | 69.8 | 67 | 70 | 66 | 72 | 74 | +1.4 | 垫底但没掉队 |
**本期的几个关键信号:**
- **头部开始洗牌**。上期第一的 Agent-A 被 Agent-B 反超(虽然只是 0.5 分),核心原因是 Agent-B 在 Prompt 和 RAG 上各有 2-3 分的实质提升,而 Agent-A 的 0.4 分几乎来自噪声。**没变化,在一定意义上就是退步。**
- **Agent-D 是本期最大的技术变量**。RAG 从 87 干到 91,直接冲到单维度第一。"检索质量"在 8 月这批企业场景里权重越来越高,谁把这口补齐谁就能往上窜。
- **Agent-H 是进步王(+4.5)**。一个上期垫底选手,靠**安全伦理维度从 80 干到 88** 硬生生抬升了名次。这印证了我们上版的判断:安全是最容易补、也最容易被忽略的短板——补上它,真能换来排名。
## 三、三个反直觉的发现
**1. "进步"和"版本号"完全是两回事。**
有家 Agent 一个月发了 3 个大版本、5 篇 PR 稿,实际复测只涨了 1 分(多半还是测试噪声)。另一家没怎么宣传,安静补了 RAG 和质量护栏,涨了 3.3 分。**宣传密度和技术增量,在数据上几乎零相关。** 采购的人如果只看发布会不看复测,很容易被版本号的节奏带偏。
**2. "最卷"的赛道恰恰是最不产生差异的。**
Prompt 工程和 Agent 架构这两个维度,8 月各家都在疯狂卷,但从数据看,头部和腰部在这两个维度上的**差距反而缩小了**。真正拉开差距的地方,变成了 RAG 质量和安全伦理——**这两个最"不性感"、最不值得发 PR 的维度。** 这很现实:大家都在改 PPT 封面,没人愿意默默修下水道。
**3. 高总分 ≠ 适合你。**
综合分最高的 Agent-B,在特定的金融场景里可能不如 RAG 最强的 Agent-D 好用。**综合分是给"什么都要一点"的通用场景用的,不是给具体业务用的。** 这也是我们反复强调的:把通用榜当"初筛",别当"结论"。
## 四、给三类人的复测建议
**给 Agent 开发者:** 别盯排名。盯"环比变化"那一列——**你的产品这一个月到底补了什么?** 如果连续两期 +0.3、+0.4,说明你在原地踏步,而对手在跑。尤其是 Agent-A,底子这么好,增量却跟不上,这是最危险的信号。
**给企业采购:** 把本期增量当"上进心"指标,把绝对值当"当下水平"指标。**一个进步快的腰部选手,可能比一个原地踏步的头部选手更值得长期押注。** 另外,一定要拿你自己的业务场景做一次实测,别拿通用榜直接拍板。
**给评测同行:** 建议大家都开始公布环比数据。**"评测"的价值不在于给出一张静态的榜,而在于持续观测变化。** 没有纵向对比的评测,本质上只是给业界贡献了一张"谁在 PR 上更用力"的排名。
## 五、关于这次复测
本次复测由**小九AI(xiaojiuai.cn)**执行:五个维度、独立打分、任务集可查。我们把这做成一个**持续复测的项目**——每个月用同一套口径跑一次,看各家到底是真进步还是刷版本号。
必须承认这版复测仍有局限:参评 Agent 数量还不多、任务集仍在扩充、部分维度(如多模态)的评分还比较粗。但**纵向对比的标准先立起来了,数据先跑起来了,这才是这版最重要的意义。**
**欢迎来评论区聊聊:你日常用的 Agent,这个月到底是"真进步"还是"纯 PR"?你踩过"版本号唬人"的坑吗?**
---
*小九AI · xiaojiuai.cn · 一个有技术深度的中文AI社区,做评测,讲真东西。*
article
中文AI Agent横向评测·更新版(2026-08复测):10款选手,谁在进步谁在躺平?
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...