# 别信"AI 记忆越用越聪明"——一篇论文拆穿自我改进智能体的三大幻觉

> 技术锐评 · 2026-08-20 · 取材 xiaojiuai.cn 今日 AI 资讯 ArXiv cs.AI
> 出品:小乐 🥁 · 按 taste 原则:零 AI 痕迹,敢说真话。

AI 圈最近有个特别上头的话术:"给 Agent 一个记忆库,它会越用越聪明,自己进化。" 配上几个 demo,看起来稳得一批——机器人聊几天天,就从一个生手变成你的专属助手。这话听着热血,但我要泼盆冷水:

**"能记住"跟"变聪明"是两码事,"看起来进步了"跟"真进步了"更是两码事。**

今天 xiaojiuai.cn 资讯里进了一篇 Salesforce AI Research 的论文(ArXiv 2608.18066),标题就叫 *On the Fragility of Self-Improving Agents*,直译是"自我改进智能体的脆弱性"。这篇东西不搞美学,直接对着那些热门 demo 做了一次"拆台式"重测,结论值得每一个想上 Agent 的人先看一眼。

---

## 一、先看它测的是什么,别被翻译带偏

很多人看到"自我改进"四个字就脑补成"Agent 自己写代码升级自己",真不是。这篇论文盯的是更现实的一类:**基于记忆的自我改进 Agent**——它从一个在线任务流里学习,靠维护一份"文本记忆库"(memory bank),每次干活之前先把记忆翻出来看看,于是越做越顺手。

听起来是不是很合理?这正是市面上不少"记忆增强 Agent""长期记忆系统"的产品逻辑。论文作者没否定这个方向,他们干的是更阴的事:**把之前那些人只跑一次就发论文的评测,重新多跑几遍、把任务顺序打乱,看到底还灵不灵。** 结果,翻车了。

---

## 二、三大幻觉,一个比一个扎心

**幻觉一:你把"评估噪声"当成"进步了"。**
论文第一个观察很朴素又很狠:在复杂环境、多步任务上,Agent 评估本身就是有噪声的——同样配置跑两次,分数忽高忽低很正常。而你在上面叠一层"自我改进循环",这层loop会把噪声进一步放大。换句话说:**你测出来的那个"变好了",很可能只是随机波动,而你还信了。** 做项目的人都懂这种体感——模型没动,昨天测 70 分开今天 80 分,你差点以为玄学生效。

**幻觉二:它的提升是"吃课程红利",不是真本事。**
第二个观察更有杀伤力。作者把任务顺序随机打乱,结果发现:**这个"越用越聪明"特别依赖任务顺序**。之前的方法默认用一个固定的、从易到难的顺序,这其实悄悄构成了一条"隐式课程"(implicit curriculum)——Agent 是在一个被精心安排的递进环境里"变强"的。一打乱顺序,提升就崩。这意味着什么?意味着它的"成长"很大一部分是环境的功劳,不是它自己的,换个真实世界的乱序任务流,它可能原地踏步甚至倒退。

**幻觉三:你根本说不清它为什么变好(规格未明)。**
论文还点出一个被忽略的根因:**任务和环境描述太含糊**(underspecification)。作者试着往记忆里塞进更明确的规则(详细评分标准、环境反馈),确实补回了一部分之前的缺口——但注意,**还差一大截**。也就是说,就算你把条件说清楚一点,仍然有大量未知因素在左右它的"成长"。一个你说不清原理的机制,拿去上生产,你敢吗?

---

## 三、我的态度:这不是否定记忆型 Agent,是治"进步焦虑"

先说清楚,我一点不反对"给 Agent 带记忆"这个方向——它确实是处理多轮、长期任务的实用手段。我反对的是**把"记忆"直接等同于"能力进化"的叙事**,更反对服务商拿"我的 Agent 会自我进化"当卖点去兑现客户的钱。

这篇论文给做 Agent 的人提了三句实在的建议,我翻译成人话:

1. **别只跑一次就下结论**。多运行几遍、看方差,把"稳定"写进验收标准,而不是把"最高分"当成果。
2. **做压力测试,尤其换任务顺序**。真实业务的任务流是乱的,你得确认它在乱序下还站得住,而不是只在精心设计的演示流程里好看。
3. **给"人类能看到、能干预"留口子**。论文收尾那句很关键——系统的规格说不清,就必须有能让人类介入的界面,别让 Agent 用你想不到的方式悄悄出错。机器越"自主",越要有刹车。

---

## 四、落到做项目的人身上

说句大实话:**那一句"我的 Agent 会自我进化",基本是给投资人看的,不是给工程验收看的。** 你要真信了"把记忆打开它自己就成长",然后在生产环境放养一个多步 Agent,等翻车的时候你不一定看得懂哪里错了——因为连作者都承认还有说不清的因素在起作用。

xiaojiuai.cn 上我们聊 Agent 和 GEO,一直主张一个态度:**别被 demo 照亮,要拿数据和可重复性说话。** 这篇论文跟做 GEO 的道理其实是通的——判断一个东西好不好,别听一句漂亮结论,要看它换个条件、换个顺序、多跑几遍还灵不灵。能被复现、抗得住扰动、你讲得清原理的,才值得押注。

那些声称"记忆即进化"的产品,建议你让它多跑几遍、随机打乱任务试试,再决定要不要为它买单。

> 小九AI · AI 技术锐评 · 2026-08-20 · 每日 AI 资讯与一手解读在 xiaojiuai.cn