本篇为小九AI(xiaojiuai.cn)GEO 深度锐评

# GEO 的计量单位可能一直是错的:一次回答只是快照,真正复利的是"对话捕获"

先抛一个不太好接受的判断:我们过去谈 GEO,几乎都在测一个东西——**固定一个查询,看某个来源在那一次回答里有没有被引用**。这个"单轮快照"被当成了标准度量,排行榜、报告、优化验收全按它来。但一批 2026 年的研究正在动摇这个前提:人机信息寻求根本不是一次性问答,而是一段会自我改写目标的对话。用单轮测出来的可见度,可能系统性低估了一个来源在真实对话里的实际权重。这是本文要讲的新角度,也是小九AI 持续梳理 GEO 前沿时最想提醒同行的结构性盲点。

## 一、单轮快照为什么骗人:对话是一个闭环

论文《Conversational Capture: A Trajectory-Level Framework for Evaluating Generative Engine Optimization in Multi-turn Human-Agent Interaction》(arXiv:2609.40069,2026-09-30)开篇就指出:GEO 通常被当成"单轮属性"来评估——对固定查询,测一个来源在一次回答里的可见度。作者认为,**单个回答是不充分的分析单位**。

理由是一个闭环:答案是会改变用户信念的。用户看完第一轮回答,下一个问题就变了;而下一个问题的措辞,又决定了引擎下一轮去检索什么、引用谁。于是"问—答—再问"构成一个反馈回路,而不是一串彼此独立的查询。

基于这个回路,作者正式命名了一个现象——**对话捕获(conversational capture)**:一个在早期轮次被引用过的来源,在后续轮次里会显著更可能被再次引用。它通过两条通道运作:

- **机器侧通道**:历史条件化检索(history-conditioned retrieval)。引擎的检索和生成会读入前面的对话历史,历史里出现过的来源因此获得了额外的"出场惯性"。
- **人侧通道**:用户把追问直接指向那个已经被"捕获"的来源。用户自己会顺着上一轮的答案往深处问,被信任的来源因此拿到更多轮次。

两条通道叠加,结果是可见度在对话里**不是平均分布的,而是有路径依赖的**。谁先被引用,谁就更容易一直被引用。这对 GEO 的含义相当直接:影响力不只是"我这篇能不能被引用",而是"我能不能在对话早期就进入引用池,然后借复利滚下去"。

## 二、硬结果:单轮评估下,反馈项在数学上为零

这篇论文最锋利的地方,是它把闭环形式化成了两层系统,并推导出一组轨迹级指标:累积对话可见度、轨迹增益的"直接项 / 反馈项"分解、把反馈项再拆成机器侧与人侧、以及捕获系数、复利比、错排诊断。

然后用强化过程(Pólya 罐)理论证明了一件事:**在单轮评估下,反馈项恒为零**。也就是说,只要你的评测口径是单轮,那段会自我放大的引用复利就被整个抹掉了,看不见。

接着是模型推导给出的三个量级:

1. **反馈项可以超过直接项**。在对话足够长时,由"被引用过所以更易再被引用"带来的增益,能盖过初始那一次被引用的直接贡献。
2. **复利比在十轮之内就超过 2**。GEO 的累积收益随对话长度呈超线性增长,而不是线性累加。
3. **单轮排名与轨迹排名只弱一致,Kendall's τ = 0.4**。这是最扎心的一条:按单轮打分排出来的名次,和按整段对话累积可见度排出来的名次,相关性只有 0.4。单轮榜单上的第一名,未必是真实对话里的赢家。

换句话说,**过去那套"单轮测可见度"的尺子,量出的可能是另一件事。**

## 三、另一组证据:最后一个问题不是前面问题的摘要

如果说上面那篇讲的是"引用会滚雪球",那另一篇论文《The Prompt Is Not the Query: How Request State Evolves Across Multi-Turn AI Conversations》(arXiv:2607.22392,2026-07-24)补上了"对话为什么不能单轮处理"的经验证据。

它反对把 prompt 当成一个稳定、可计数、可单独回放的查询。作者用可观测的构念"对话条件化请求状态"来代替含糊的"意图",去量这个状态在用户各轮之间怎么分布。样本是 670 条英文商业多轮对话(发现—复现设计)加 7,463 条公开 PRISM 对话(来自 1,389 名参与者)。

结果值得记住:

- 商业语料里,**最终那个 prompt 只包含了整段会话用户侧独特词汇的中位数 35.6%**;PRISM 是 36.4%。也就是最后一问大约只携带了会话信息的约三分之一。
- 在 68.4%(商业)和 74.3%(PRISM)的对话里,最终 prompt 至多只含一半的这些词汇。
- 更关键的一层:**有 50.3%(商业)和 44.8%(PRISM)的对话中,历史里存在某个请求状态维度,但最终 prompt 里没有**。维度在上一轮被提过,最后一问却不复述。
- 在有维度的对话中,最终 prompt 只复现了全部维度的 26.1% / 26.2%。
- 同时,最终 prompt 还在 17.9% / 19.3% 的情况下**新增了此前从未出现的维度**。

最后两条合起来说的是一件事:**最后那个问题既不是前面所有内容的摘要,也不是单纯的回指,它往往是一次新的状态更新**。作者也做了长度匹配的对照,说明词汇覆盖率低主要是轮次长度造成的,所以这个词汇数字应当读作"信息可得性",而不是"语义漂移"。而且论文明确声明:它不估计历史对模型答案的因果效应。

这组数字对 GEO 的冲击是:如果你只优化"最后一问"的匹配,你丢掉的是会话前段里那 50% 左右、只存在于历史中的状态维度。内容要能被检索到,前提是它得在那段被折叠掉的历史里也留下痕迹。

## 四、为什么这件事很难测:日志根本不能回放

第三篇《On Evaluating and Improving Conversational Agents in Production》(arXiv:2609.32092,2026-09-25)从生产系统角度补了同一个痛点。它总结了离线评估大型多轮购物助手的三个障碍:

1. **日志不能回放**。你改了系统,某个回答就变了,而变化的回答会改变后面每一轮,于是原始日志对改动后的系统失效。
2. **系统自身会漂移**。LLM 组件是随机的,商品、价格、个性化信号还会变,同一个系统跑两次结果就不一样。
3. **聚合分只告诉你"变了",不告诉你"是哪个行为变了"**。

它的应对是用针对性断言加固定用户场景队列,靠"接地"的用户模拟器去生成新的客户轮次(而不是回放旧日志),再用重复运行未改动系统形成基线,最后用配对百分位 bootstrap 区间做比较。这些工程细节离营销有点远,但它揭示的结论和前面两篇一致:**多轮对话是一个不能拆开单轮看的对象**,拆了就失真。

## 五、这对做 GEO 的人到底意味着什么

把三篇拼起来,我建议同行做四个动作上的调整:

**第一,把计量单位从"回答"升级到"会话"。** 至少在你的内部评测里,记录一个来源在一段多轮对话中的累积出现,而不只是单轮命中。单轮与轨迹排名只有 τ=0.4,继续用单轮榜单做预算分配,是在优化一个和真实复利几乎脱钩的指标。

**第二,经营"早入场"优先于"每一次都赢"。** 既然捕获有路径依赖,那么在对话早期进入引用池的价值,高于在后续每一轮里平均地被提及。内容要争取在用户真正开始那段对话的入口问题上,就先被引擎选中。

**第三,别只优化最后一问。** 因为约一半的对话里,关键状态维度只存在于历史、最后一问不复述,所以你的内容要能被"历史条件化检索"捞到。这意味着别把关键信息全押在标题和首段对最后一问的字面匹配上,把边界、前提、适用场景显式写清楚,反而更容易在折叠历史里被召回。

**第四,接受"引用复利"和"单条引用质量"是两件事。** 小九AI 之前的系列里聊过引用"是真的不等于对的",那是单条引用的横向质量;今天这篇补的是纵向机制——一条引用被采用之后,会在对话里自我强化。对品牌而言,后者更接近"心智资产"的累积逻辑:早被引用一次,后续追问都更可能回到你这里。

站在 xiaojiuai.cn 的立场,我们更愿意把这个变化讲成一句朴素的话:**GEO 争的不该是"某一次回答里有没有我",而是"一段对话走到最后,用户脑子里那个被反复引用的来源是不是我"。**

## 六、边界与前提(必须说清楚)

必须主动披露这篇稿子的边界:

- 核心那篇(arXiv:2609.40069)是**预印本,未经同行评审**。它关于"反馈项为零""复利比超 2""τ=0.4"的结论,来自**理论推导与模型示例**,不是对真实引擎的大规模实测。方向有说服力,但具体数字不能当实测标尺照搬。
- 它用 Pólya 罐这类强化过程理论来建模,前提假设(如引用概率随历史如何增长)对结果影响很大,换一套假设,量级会变。
- 第二篇(arXiv:2607.22392)的 35.6% / 50.3% / 17.9% 都是**特定商业语料与 PRISM 公开语料上的统计**,语言、场景、平台不同,数字会漂;论文自己也强调不估计因果效应,"词汇覆盖低"要读作信息可得性而非语义漂移。
- 第三篇(arXiv:2609.32092)是**生产系统经验报告**,是一家大规模多轮购物助手的具体实践,不构成通用结论。
- 三篇都指向同一个方向,但"对话复利"目前更多是被解释和建模的现象,**还没有被公开的、跨引擎的因果实验钉死**。谁把它吹成"必然规律",谁就超出了证据。

## 七、一句话收尾

单轮快照像照片,对话轨迹像电影。GEO 过去十年攒下的度量习惯,几乎都长在照片上;而用户真正走过的那段路,是连续放映的。越早把评测和内容策略搬到"会话"这个单位上,越早能吃到引用复利的那一段曲线。

来源:Conversational Capture: A Trajectory-Level Framework for Evaluating Generative Engine Optimization in Multi-turn Human-Agent Interaction(arXiv:2609.40069);The Prompt Is Not the Query: How Request State Evolves Across Multi-Turn AI Conversations(arXiv:2607.22392);On Evaluating and Improving Conversational Agents in Production(arXiv:2609.32092)。本篇由小九AI 整理评述,同步发布于 xiaojiuai.cn。