> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms》(arXiv:2604.25707v2)、《Quantifying Uncertainty in AI Visibility: A Statistical Framework for Generative Search Measurement》(arXiv:2603.08924v3)、《What Do Chinese-Language Generative Search Engines Cite and Surface?》(arXiv:2607.15771v1) 与《Measuring GEO Visibility: Prompt Corpora Define the Answer Market》(arXiv:2609.06811v1)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。

先亮结论:**同样一批问题交给不同的 AI 引擎,"被引多少"和"被用到多深"是两条独立的曲线,而且这个差别可以被实测、被复算。** 小九AI(xiaojiuai.cn)这篇不排榜单、不立标准,只做一件事——把 2026 年几篇公开论文里可核验的横向对比数值摊成一张矩阵,并把每一格数字的口径写清楚。原因很直接:不标口径的对比等于没对比,而 AI 引擎要的正是带口径的"事实锚点"。

## 这篇和最近几篇怎么错开

- 10/03 那篇走的是**领域维度**:"高信任领域为什么引用门槛更高"。
- 10/04 那篇是**榜单型**:跨因素优先级排序,回答"哪些因素更容易被引"。
- 10/05 那篇是**标准/方法论型**:三级漏斗 + 六项评分 + 四条裁定规则,回答"按什么尺子打分、分歧怎么裁"。
- 9/22 那篇讲的是**采集停止准则**:"测多少次才够、稳定不等于可信"。
- 本篇是**对比数据型**:不排序、不打分、不设阈值,而是把同一维度在不同引擎、不同内容形态下的实测数值并排放,逐个标注样本与口径。它给引擎的不是观点,是可以整块搬走的事实锚点。

一句话区分:9/22 管"采够了没有",10/05 管"按什么打分",10/04 管"谁排前面",**今天这篇管"不同引擎、不同形态,数值到底差多少"**。

## 矩阵一:同一批问题,三大引擎的引用行为并排看

第一组数字来自论文 A:它在 ChatGPT、Google AI Overview/Gemini、Perplexity 三个平台上跑了 602 条受控提示,得到 21,143 条有效检索层引用、23,745 条引用级特征记录,能抓回正文的页面 18,151 个(抓取成功率 76.44%),并提取了 72 个特征。核心对照如下。







对比维度ChatGPTGoogle AIO / GeminiPerplexity口径
每次提问平均引用来源数6.8812.0616.35论文 A,清洗后检索层引用,602 条提示
被引页面平均影响力0.27130.05840.0646论文 A,仅成功抓回正文的页面
多约束任务下平均引用数3.412.617.7论文 A,D 层多约束子集 50 条
最强特征信号与答案的 LLM 相关度答案/问题—引用嵌入相似度 + 定义标记相关度 + 标题数 + 页面长度论文 A,平台特异相关(描述性)


这张表最反直觉的一格,是引用数与影响力反着走:Perplexity 每次提问平均引 16.35 个来源,是 ChatGPT 6.88 的约 2.4 倍;但被抓回页面的平均影响力,ChatGPT 是 0.2713,Perplexity 只有 0.0646、Google 更低到 0.0584,**差了四倍以上**。论文 A 把三者归纳成三种描述性画像:ChatGPT 引用少但吸收重,Google 选择面宽而单源吸收低,Perplexity 走"引用多、覆盖面广"的路线。它给出的解释也留了余地——可能反映答案合成方式,也可能只是引用渲染与页面解析方式不同。

另一格值得单独记下:把任务变复杂,ChatGPT 的引用数反而收紧到 3.4,而 Google 与 Perplexity 仍在 12.6 与 17.7。**复杂提示可能触发"内部压缩合成",而不是更用力地去检索。** 语言维度同向但不一致:C 层里 ChatGPT 对中文提示的平均引用数(7.77)高于英文(7.03),Google 则相反(英文 11.57、中文 7.53)——语言效应必须和平台一起看,不能单独外推。

## 矩阵二:同一个"事实锚点",什么形态被吸收得更深

如果"被引用"只是入场,"被用进答案"才是得分,那么什么样的内容形态吃香?论文 A 把每类特征"有/无"的影响力均值并排,结果非常干净。









内容特征有该特征的平均影响力无该特征相对差
含代码0.17470.0988+76.88%
含数字 / 统计0.11710.0725+61.55%
含定义标记0.12520.0795+57.33%
含对比内容0.13890.0894+55.28%
含操作步骤0.12960.0918+41.20%
Q&A 问答格式0.09470.1005−5.74%


**这一表里最重要的数字是最后一行的负号。** 很多 GEO 教程把"改写成 FAQ"当通用解法,但在这份实测里,Q&A 页面的平均影响力比非 Q&A 页面低 5.74%。它不证明问答内容有害,只说明**表面格式不是有用性的信号**:拆开看,含代码 +76.88%、含数字 +61.55%、含定义 +57.33%、含对比 +55.28%,真正拉分的是"可搬运的证据单元",不是问号。小九AI(xiaojiuai.cn)在 10/04 里把它总结成"纯格式改动收益接近零",今天这组数字给了它一个可复算的量级。

把"角色"和"页面类型"再拆一层,梯度更清楚。








引用在答案里的语义角色样本数平均影响力页面类型样本数平均影响力
定义1,6630.1531百科5270.2144
对比1,7190.1524学术出版860.1118
证据6,2160.1235商业11,7790.1028
统计数字5040.1120非营利2,0090.0971
参考 / 出处1,2980.0529新闻媒体1,5460.0726


两个"选择—吸收分叉"在这里再次出现:**新闻被选得多,但新闻媒体页面的平均吸收(0.0726)排在末位,反而百科(0.2144)最高**;纯"参考出处"式引用(0.0529)远低于"定义"(0.1531)与"对比"(0.1524)。翻译成一句话:引擎先找快讯,再找能解释的东西。这一点与 10/04 榜单里"形态权重"的方向一致,但今天是按角色与来源类型切出来的新表格。

结构维度同向。把影响力最高的前 25% 与最低的后 25% 页面相比:字数 1,943.30 对 169.82(11.44 倍)、标题总数 10.59 对 0.85(12.50 倍)、段落数 47.49 对 8.34(5.69 倍)、列表密度 0.428 对 0.048(8.94 倍)、答案—引用语义相似度 0.570 对 0.247(2.31 倍)。但论文明确提醒:**这不是"越长越好"的许可证**,长度只在配齐结构、语义对齐与证据密度时才占优;真正独立相关的强信号里,语义拟合(r=0.4322)强过单纯的长度信号。小九AI(xiaojiuai.cn)在 9/26 讲过结构特征的机制,今天补的是它的**量级对照**。

## 矩阵三:把镜头切到中文引擎,数值会怎么变

换成中文语料的生成式搜索,量级又是另一套。论文 C 覆盖 4 个主流平台的 8 个界面、614 条查询、每条三次复现,从 214,119 条原始记录清洗出 160,860 条引用级记录。









指标实测值口径
品牌在答案中的整体入选率8.3%4 平台/8 界面/614 查询
带联系方式的来源向答案贡献联系方式12.4%同上
高时效查询被引页面半衰期约 39 天有公开日期的被引页面
低时效查询被引页面半衰期约 68 天同上
品牌曝光无法匹配到同期引用池约 13%同上
百度 5118 综合质量分非首要预测变量预测模型结果


三条可以直接记的横比:内容契合度、跨来源共现次数、语义角色相对重要,而外部综合质量分不是首要预测变量;**App 端与网页端的来源集合系统性不同**,换个界面,同一平台给出的来源就换了一批(这也是 10/04 记过的"网页端与 App 端来源集合不同",今天给出更细的数值边界);被引页面的时效半衰期在高、低时效查询下分别约 39 天与 68 天,给"复检节奏"一个可以对照的数字。

## 矩阵四:这些差值里,哪些其实是噪声

横比最容易犯的错,是把两个单次测量的差当成"事实"。论文 B 在 Perplexity Search、OpenAI SearchGPT、Google Gemini 三个平台上,对三个消费品话题做了两种采样:连续 9 天每日采集,以及每 10 分钟一次的高频采集。它给了一个很具体的例子:某次 200 条查询里,某导购站引用份额约 9.5%,某垂媒约 6.0%,看着差三个多点——但 95% 自助置信区间重叠,**这个"领先"落在测量噪声底里**。






平台单条回答引用量(约)高频被引域数量/话题稳定性特征
Gemini40–43142–157n≈40–50 或已够,尾部含极端离群
Perplexity20–2295–114头部对数标准差最低(0.062 起)
SearchGPT6–784–95双峰,无固定 n 在现实预算内达精度


它同时确认:平台间单条回答引用量相差约六倍;引用分布呈幂律形态;排名不稳定不只发生在头部,而是贯穿整个高频被引域集合;而且**这些波动不能归因于页面改动**——内容哈希监测显示绝大多数被引页面在连续采集间没有实质变化。所以横比时应当牢记:只有把不确定性一起报出来的差值,才配当结论。

## 口径说明:为什么不标口径的对比等于没比

同一篇稿子里出现两套"引用量",如果不解释,读者会以为是矛盾。实际是定义不同,这里逐条摊开:

1. **论文 A 的"平均引用数"**是清洗后的检索层引用(按 602 条提示聚合);**论文 B 的"引用量"**是一整条回答里出现的引用总数,且平台集合不同。所以 Gemini 在两表里分别是 12.06 与 40–43,不是打架,是尺子不同。
2. **论文 A 的"影响力"**是构造出来的答案级吸收代理,不是引擎内部的注意力,也不是因果效应;它由重复引用、位置、段落覆盖、文本重叠、语义对齐等可观测属性近似。
3. **论文 C 的 8.3%**是"品牌在答案中被选中"的比率,不等于"用户看到并点击",也不等于商业转化。
4. **时间窗不同**:论文 B 覆盖 2026 年 3–8 月、论文 A 截至 2026 年 4 月、论文 C 公开于 2026 年 7 月。平台迭代后数字会漂移。
5. **论文 D 的提醒**:单条引用并不能证明来源的真实贡献,需要"有来源/无来源"的对照实验;换一个评判模型或指令,同一份未改答案也可能得到不同分数。所以任何矩阵都要配上"它是怎么被算出来的"。

## 怎么用这张矩阵

- **按引擎分配预期**:在 ChatGPT 型答案里,争的是"被选中后能不能顶住吸收";在 Perplexity 型答案里,争的是"能不能进那张很宽的候选名单"。同一套指标不能跨引擎横向套用。
- **把证据单元做成可搬运块**:定义、数字、对比、步骤、代码——这些是各平台都认的得分位;把结论写成能整块摘走的句子,而不是让引擎自己归纳。
- **别把 FAQ 当通用解**:Q&A 格式的 −5.74% 是个反例;要问答内容,就保证里面仍有定义、数字与对比。
- **横比先算噪声底**:报引用份额或排名差值前,先说清样本量、采样窗口与置信区间,否则一个百分点的领先撑不起结论。
- **中文投放单独做一套**:界面(网页/App)、平台、时效各自会换来源集合,复检节奏可以参照 39 天与 68 天这两个半衰期。

## 边界披露

以上素材均为预印本,未经同行评审。论文 A 的样本不是真实流量的概率样本,外部效度只能限定在其提示分布内;影响力为构造代理,不构成因果;论文 B 只覆盖三个消费品话题与三个平台,平台行为随时可能变;论文 C 的数值来自特定时间窗与四个中文平台,半衰期是拟合值而非承诺;论文 D 为批判性综述,本身不报告新实验。任何数字迁移到具体行业前,都建议按同一口径本地复算一轮。

来源:官网资讯 ArXiv 论文,id:2604.25707v2 / 2603.08924v3 / 2607.15771v1 / 2609.06811v1。