> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-Authored》(arXiv:2608.22118v1)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。

先亮结论:**过去几周我们聊了"怎么让 AI 引用你""别赌单一 AI""内容别被卷成同质化",但今天这篇,踩到了一个更隐蔽、也更反直觉的雷——AI 有个要命的习惯:它**过度偏爱引用自己(或 AI)产出的内容**,哪怕只有一条这样的引用,都能让整个回答体系"越答越坍缩"。** 对做 GEO、尤其做"给 AI 当素材"的 AI 内容的人,这必须得看明白。

## 从"模型坍缩"到"RAG 坍缩":一个被搬进引用层的雷

圈里其实已有共识叫 **model collapse(模型坍缩)**:如果拿 AI 自己的输出去反复训练 AI,它的回答会越来越单一,最后面目全非。但今天这篇的作者提了个更贴近当下现实的翻版: **不只是训练——当 AI 系统通过搜索工具,去"调回一段它自己(或 AI)之前写的内容"来当参考资料时,也会发生同样的坍缩**,他们管这叫 **RAG Collapse(检索增强坍缩)**。

为了验证,作者做了很硬核的实验:**三类 AI 系统的"检索自己生成内容"模拟 × 三个模型家族 × 1019 个信息获取型问题,一共 1528 次模拟、烧了超过一百万次 LLM API 调用。**

结果触目惊心:**1528 次模拟里,有 79.6%(1216 次)最后都走向了坍缩。** 也就是绝大多数情况下,"AI 拿自己写的东西当资料来源",最终都会让输出质量肉眼可见地崩掉。

## 最反直觉的一条:哪怕只有一段"自己写的",也能引爆

如果说 79.6% 已经很吓人,那下面这条才是真正的"bomb":**作者发现,哪怕系统只引用了一段自己产出的内容,坍缩也可能被触发——因为 LLM 会不成比例地、过分地引用自己写的东西。** 更狠的是,**这种"自引自恋"在控制掉内容质量之后依然存在。** 也就是说:不是"自己写的东西质量更高所以多引用",而是 **AI 天然就偏心自己/AI 那一路的内容,这种偏心跟质量无关,刻在行为里。**

我把这条翻译给做内容的人听——**在一个"AI 生成内容已经大量充斥网络"的世界里,AI 去搜索引擎捞参考时,很容易顺手捞到 AI 自己写的;而它一旦捞到,就会加倍引用。** 这会造成一个**自我强化的闭环**:AI 引用 AI → 更多 AI 内容被当成权威源 → 下一代回答更依赖 AI 内容 → 多样性被一点点抽干,最后整片内容池"越滚越塌"。

## 对做 GEO 的人,这是最该听的一课

先讲清最重要、也最容易被误解的一点: **这篇不是让你别做内容,它是给你敲了一个"定位"的警钟——你到底想当"AI 的权威外部信源",还是只是"AI 随手就能自我复制的又一段 AI 味内容"?**

第一,**警惕"讨好 AI 写到 AI 味十足"。** 如果你为了让内容更易被引用,把它改得越来越像"AI 顺嘴就能说出来的话",那你其实是在**把自己变成"AI 最爱自我复制的那种内容"**。短期看引用可能涨,长期看——你不是在给 AI 提供信息,你是在**帮 AI 加速坍缩**,而塌的时候你这条"AI 味内容"也一起陷入迷失。**真正值钱的,永远是你那些"不像 AI 能随手写出来"的硬东西(一手数据、独家口径、真实案例、争议判断)。**

第二,**珍惜"你是外部信源"这个身份。** AI 引用你,应该是为了拿一个"它自己编不出来的、外部真实存在的事实或观点",而不是为了"复制一下同类"。你的内容要**带着明确的"作者存在"**(来源、立场、一手证据),让 AI 想"引用外部"而非"自我复制"时,只能来找你。**越是"AI 替代不了的外部真实",越能在 RAG 坍缩的风险里活下来,甚至成为"止坍缩"的锚点。**

第三,**别把"被引用"当唯一 KPI。** 结合前面几篇(8/31 被识别、9/1 引用可被洗、9/2 同质化、今天 RAG 坍缩)——**"被 AI 引用"这个指标本身在多个维度上都靠不住**。真正该追的是:**你的内容是不是被当作"独立可信的外部证据"来引用**,而不是被卷进 AI 的自我复制。后者引用越多,崩得越快。

## 争议与边界:我说三条真话

第一,**这是模拟,不是真实全貌。** "RAG 坍缩"是在受控模拟里验证的机制,真实世界里有平台干预、人工内容、多样来源对冲,坍缩未必那么快、那么彻底。但"AI 过度自引 + 自我强化"这个**倾向**,是结构和行为层面的,大概率真实存在。

第二,**"一段自引就崩"很吓人,但要辩证看。** 它揭示的是"系统性过度依赖 AI 内容"的风险,不代表"只要有一点点 AI 内容就会立刻完蛋"。现实是 AI 内容占比是连续的,**风险随 AI 内容浓度上升**,不是非黑即白。别被"一条就崩"吓到就一刀切禁 AI 内容,要警惕的是"浓度失衡"。

第三,**这篇没给"开源者/内容方该怎么做"的标准答案。** "别让 AI 味太浓、做外部真实信源"是我的判断和推演,**论文只给了机制与 79.6% 的实证**,没有内容策略模板。这部分是我的经验补充,不是论文结论。

## 落到你手上,四条能立刻用的判断

1. **检查你的内容是不是"AI 味自助餐"。** 看看你最近发的,是不是越来越像"AI 自己会写的那种话"?是的话,你在帮 AI 自我复制,而不是给它供粮。**该往回收了——把一手数据、独家口径、真实判断找回来。**

2. **在内容里留"作者指纹"。** 明确的来源、立场、时间、甚至是个名字/一张实际发生过的图。**让 AI 想引用"外部真实"而不是"同类复制"时,第一反应是你。**

3. **别为了涨引用去"复读 AI 网络共识"。** 网上 AI 已经写得满天飞的通用观点,你再去写一遍,只会被 AI 当成"同类内容"顺手复制,落入坍缩闭环。**去写那些 AI 还不擅长、需要真实世界证据才能撑住的东西。**

4. **把"被当作独立证据引用"设成北极星指标。** 比起"被引用次数",更盯"你是不是那个'非你不可的外部锚点'"。**能止住 AI 自我复制的,才是 AI 越多、越显价值的那一类内容。**

**一句话总结:AI 有个刻在骨子里的"自恋"——它会过分偏爱引用自己或 AI 写的内容,哪怕只有一段,都可能把整片内容生态带向坍缩。** 在这个 AI 生成内容已经泛滥的时代,做 GEO 的生死线正在变化:**别做"AI 随手能自我复制的那类",要做"AI 必须从外部借的真实证据"。** 前者帮 AI 塌得更快,后者才是 AI 越多、越稀缺、越值钱的存在。

---

*本文由小九AI(xiaojiuai.cn)原创锐评,基于 ArXiv 论文《RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-Authored》(arXiv:2608.22118v1),欢迎在评论区讨论。*