> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research》(arXiv:2608.24306v1)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。

先亮结论:**做 GEO 这么久,我们默认"被 AI 引用"就是被某个 AI 一次性检索到、顺手引一下。但你有没有想过——现在越来越多的 AI 不是"答你一句话",而是"派好几个 Agent 出去搜一圈,再拼成一份带引用的长报告"?** 这种叫 **Deep Research(深度研究)** 的新形态,正在成为内容被消费的重要入口。这篇论文告诉我一个做 GEO 的人必须知道的事实:**在这种多 Agent 流水线里,你的内容会像玩"传话游戏"一样被一层层转手——而引用,就在这传话里悄悄丢了、错了、或安在别人头上了。** 关键还不只是"会不会被丢",而是——**到底该怪谁?**

## 新的战场:Deep Research 正在改变"被引用"的方式

先科普一个正在发生的变化。以前的 AI 搜索,大多是你问一句、它立刻搜一下、给一段带引用的回答——这是"单跳"。但像 GPT 的深度研究、各家出的 Deep Research 这类,是**"多跳 + 多智能体"**:它会先拆解你的问题,派一个 Agent 去搜资料,另一个把资料整理,再来一个拼装成报告,最后还有一层负责加引用、排结构。**中间经过的 Agent 越多,你的内容被"原样保留"的概率就越低。**

论文用了个很准的比喻:**信息在这些 Agent 之间传递,就像玩"传话游戏"(telephone game)——每一层都可能把内容和引用"说走样"。** 更麻烦的是,这种系统的引用召回率(该引的引全了没)目前普遍很差,可偏偏引用又是用户判断报告可不可信、是不是真读到你的**唯一抓手**。**一手抓不住的东西,偏偏是判断真假的唯一凭证——这个矛盾,就是做内容的人要盯的雷。**

## 论文的洞察:不只是"引用错了",是"该怪谁"根本说不清

作者做了件很关键的事:不是笼统说"DR 引用不准",而是**精确定位每一处错误到底是哪个 Agent 引入的**。方法上,他们逐个对 Agent 的调用做"忠实度 + 可验证性"的局部测试,并且把错误分成了四类:幻觉、引用了没读到的、输出了没引用的、引用数量不够。

他们对**三款顶级开源 DR 系统**跑了一遍,得出几个对做内容很有用的硬观察:

- **几乎每个 Agent 都会犯错,唯一的例外是"只负责总结单个文档"的那类 Agent——它几乎不出错。** 这提示了一个很反直觉的点:**离原始内容越近的环节越可靠,错都错在"层层加工、信息汇合"的上层。**
- **不同 Agent 的"主错误类型"不一样**,尤其**总调度者(orchestrator)的错,绝大多数是引用层面的**。
- **最扎心的一条:在 AI-Q 这个系统里,最终报告里 84.7% 的错误是总调度者引入的,其中约 31% 是幻觉,剩下的是引用错误。** 换句话说——**你的内容常挂在"把大家搜来的东西拼一起"那一层上**,那儿最把不住关。

好消息是:**顺着这个诊断,两个很简单的干预就能把引用召回率提高 5%,还不损伤输出质量。** 说明这病能治,不是无解的。

## 对做 GEO 的人,这意味着什么

先讲最容易误读的点:**这不是否定 GEO,也不是让你别做内容——它说的是"内容被消费的形态变了",你的策略得跟着变。**

第一,**Deep Research 正在成为"新的一级入口",但它把内容加工了好几层才端给用户。** 你以前赌的是"AI 会不会一轮就搜到我、引到我",现在多了一个变量:**就算它搜到你了,你的关键信息能不能扛过后面那几层 Agent 的筛选、压缩、拼接,最后还能对得上你、引到你的出处?** 单跳时代"被搜到=有机会被引",多跳时代"被搜到"只是万里长征第一步。

第二,**"引用召回率差 + 该怪谁说不清" = 你的内容可能"被用了却没被署名"。** 这里引出一个很现实的问题:当 AI 深度研究报告里明明借了你的一手数据/结论,却因为 orchestrator 那层引用没跟上、或把出处安给了别家,你**连"被引用了"都不知道**,更别谈去主张可见度。**这就是 GEO 版"被白嫖"的新形态——不是故意洗引用(那是另一篇),而是多级加工里自然地把你"用掉了却没归对号"。**

第三,**别只盯着"让单次搜索引用你",开始想"让内容能扛过多跳加工"。** 单文档总结 Agent 几乎不出错这个发现,其实给了内容方一个方向:**把一块内容做成"自洽、单点可引、自带完整出处和上下文"的独立单元**——那样无论它被传到哪一层,都能被"干净地引用",而不是被拆碎后张冠李戴。**能"单点自足"的内容,就是最能扛传话游戏损耗的内容。**

## 争议与边界:我说三条真话

第一,**这篇只验了三款开源 DR 系统**(含 AI-Q),主流闭源系统未必同构,84.7% 这个数字是特定系统的,别当行业通识。但它揭示的"多级加工会损引用"的**机制**,是结构性的、大概率普遍存在的。

第二,**"引用了"不等于"用对了"。** 这篇解决的是"引用召回(该引没引/引错归属)",至于"引到了却断章取义地乱用",那是更深一层、也更难的问题——引用召回提升 5% 是进步,但离"内容被准确理解"还很远。

第三,**"离源越近越可靠""单点越自足越稳"是我的推断,论文只给了"总结单文档的 Agent 几乎不错"这个观察。** 从观察到"该做成独立自足单元"之间,还有我的经验判断在,不是论文直接给的答案。

## 落到你手上,三条能立刻用的判断

1. **别再把"被 AI 引用"想成一次性的单跳事件。** Deep Research 这类多 Agent 长报告正在成为主入口,你的内容要在"被搜到"之后,**还能扛过压缩、拼接、层层转手**。把它当成"要在传话游戏里活着过关",而不是"被某一次检索撞上"。

2. **把内容做成"单点自足"的独立单元。** 一段结论自带出处、自带口径、自带上下文,**让任何一层 Agent 拿到它都能"干净地引对、不歪曲"**。越是能被整块引用、不依赖前后文才能懂的内容,越不容易在传话里被丢或张冠李戴。

3. **为"深度研究报告会引用你"去布局,而不是只盯聊天式回答。** 这要求你把最难、最不可替代的一手数据/结论,做成明确的、可被单独引用的知识块——**那是 orchestrator 想揉进报告时,最愿意直接抄走、也最有理由给你署名的东西。**

**一句话总结:AI 正在从"答你一句话"走向"派一群 Agent 替你写一份深度报告"——而在那条多级流水线里,你的内容会因为"传话游戏"被丢了、错了、或安错名。** GEO 的下一个分水岭,不是"能不能被搜到",而是"**能不能在层层加工之后,还被对得上、还被归对号**"。能扛过传话损耗、能被单点干净引用的内容,才是 AI 深度研究时代最大的赢家。

---

*本文由小九AI(xiaojiuai.cn)原创锐评,基于 ArXiv 论文《Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research》(arXiv:2608.24306v1),欢迎在评论区讨论。*