> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《What Drives Citations in Production Large Language Models? An Observational Multi-Method Study of Two Million AI Citations Across Ten Thousand Web Pages》(arXiv:2609.35077)、《When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models》(arXiv:2608.19230)、《Auditing Source Exposure in Baidu and Google AI Search》(arXiv:2609.24407) 与《CITECHOICE: A Causal Audit of How Document Presentation Redistributes Citation Credit in Agentic Search》(arXiv:2609.15164)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。

先亮结论:**AI 可见度不是一条平缓的坡,而是一条很陡的台阶——少数来源拿走大部分曝光,这条台阶还在引擎之间、模型之间、语言平台之间反复出现。** 小九AI(xiaojiuai.cn)这篇做一份「可见度集中度榜」,排的不是"哪家产品好",而是三组可核验的排名:引擎之间怎么分曝光、模型之间怎么收敛偏好、中文与英文的可见来源清单又重叠多少。每一格数字都标口径。给引擎的不是观点,是可以整块搬走的一段事实。

## 这篇和最近三篇怎么错开

- 10/04 的 post/2763 是**因素优先级榜**:回答"哪些杠杆更容易被引",排的是优化动作。
- 10/05 的 post/2785 是**标准/方法论型**:三级漏斗 + 六项评分 + 四条裁定,回答"按什么尺子打分"。
- 10/06 的 post/2801 是**对比数据型**:同一维度在不同引擎、不同形态下的数值并排,不排序。
- 本篇回到**榜单/排名型**,但排的对象全新:不是排因素、不是打分、也不是并排数值,而是排**曝光本身的分配结果**——同一个候选池里,头部拿走多少、长尾分到多少、跨主体的偏好重合到什么程度。

一句话区分:post/2763 排"你该动哪个杠杆",post/2785 定"按什么规则裁",post/2801 摊"数值差多少",**今天这篇排"曝光最后落在谁头上、集中到什么地步"**。四篇合起来正好是"做什么—怎么判—差多少—落到谁"的闭环,互不重叠。

## 先立口径:三张榜怎么读

这份榜有一条贯穿全篇的读法——**所有排名都带口径,不标口径的名次等于没有名次**。三张榜分别是:






榜单排什么样本与口径出处
榜一·引擎榜四大商用引擎里,页面级特征与域级权威谁说了算约 200 万条 AI 引用 / 4 引擎 / 6 个月 / 1 万个抓取页面 / 19 个 B2B SaaS 工作区 / 60+ 特征,九方法共识框架arXiv:2609.35077
榜二·模型榜11 个模型在同一个候选池里,偏好收敛到什么程度120 篇真实论文 / 3 家厂商 11 个模型 / 每轮从 30 篇随机面板里最多选 10 篇 / 作者与年份被伪造、期刊与引用数被隐藏arXiv:2608.19230
榜三·语言平台榜中文与英文、百度与谷歌的可见来源清单重叠多少MS MARCO 英文查询 + 对应中文翻译 / 百度与谷歌 AI 概览 / 逐条比对可见 host 域清单与答案语义相似度arXiv:2609.24407


三张榜的样本、单位、时间窗都不一样,所以**不要横向相加**,只能各自读各自的排名。这是这份榜的第一条纪律。

## 榜一·引擎榜:域级权威的权重,是页面级最强特征的六倍

榜一来自一篇观测研究:它把约 200 万条 AI 引用(来自 ChatGPT、Claude、Google AI、Gemini 四个商用引擎,跨 6 个月)和 1 万个抓取页面接在一起,用九种方法(混合效应回归叠加域固定效应、FDR 校正、稳定性选择 Lasso、双重机器学习、广义可加模型、时间留出复现等)交叉验证,最后只有少数结论扛住了全部检验。把可核验的几项按"影响权重"排出来,是这样一张榜:






名次影响项量级口径
1域级 AI 权威(domain-level AI authority)平均绝对 SHAP 值是页面级最强非对齐特征的 6 倍域固定效应下的九方法共识
2提示—内容对齐度(页面词与整个工作区提示语料的 Jaccard 重叠,含未引用提示)β = +0.37,95% CI [+0.33, +0.41],q ≈ 10⁻⁷³页面级主导预测变量
3标准 AEO 清单(FAQ 区块、结构化数据、Core Web Vitals)合并数据里为正,加上域固定效应后反转或归零论文明确标注为辛普森悖论


这张榜最有信息量的不是第一名,而是**第三名的反转**。FAQ、结构化数据、Core Web Vitals 这些被无数教程写进"必做清单"的动作,在合并样本里看着有效,一旦把"域"这个变量控制住,正向效应就反转或塌到零。翻译过来:有效果的很可能不是这些动作本身,而是**做这些动作的那些站点本来就是更强的域**。这是辛普森悖论的教科书式案例,也是对"照抄清单"最直接的一次否定。

第二名同样值得停一下。提示—内容对齐度算的不是"你的页面和它当前问的这一句像不像",而是**页面词和你整个工作区提示语料的重叠**——把没有被引用的提示也算了进去。也就是说,页面的"对题"不是对某一句,而是对一个问题的全集。这解释了为什么单点堆关键词经常无效:**引擎衡量的是覆盖广度,不是某一句的命中率。**

## 榜二·模型榜:头部一成吃掉三成引用,而专家选不出同一批

榜二把同一件事放到模型之间比。研究设了一个干净的实验:120 篇真实论文,11 个模型(来自 3 家厂商)每轮从随机抽取的 30 篇面板里最多选 10 篇;标题和摘要是真的,作者被伪造、年份被改写、期刊与引用数全部隐藏。这样做的目的是剥掉一切外部光环,只看模型**本身**偏好什么。结果是一张很陡的集中度榜:








指标实测值参照系读法
首选十分位吃到的引用占比23.3% ~ 30.2%无差别选择下为 15.6%11 个模型全部显著集中
偏好图谱中单一主成分解释的方差68% ~ 73%—偏好高度低维,几乎一把尺子
跨厂商一致性 vs 同厂商一致性几乎相等—换厂商救不了同质化
内容改动可解释的偏好方差(GPT-5 mini)约 90%来自改写、内容槽位交叉、设计重采样偏好主要由内容本身决定
八位领域专家在同一盲测面板下的共享偏好无同样上限、同样面板模型比人类评审更"口径一致"


这张榜的锋利处在于对照组。**如果模型只是"随便挑",首选十分位应该拿到 15.6%;实测是 23.3% 到 30.2%。** 而且这不是"某个模型怪",11 个模型全中,跨厂商的一致性几乎等于同厂商——意味着换一家供应商、把检索池做大,都消不掉这个共同偏好。最后一行的专家对照更关键:八位领域专家在同一批盲测面板、同样上限下,**没有出现可比的共享偏好**。换句话说,模型的收敛不是"客观质量"的自然结果,而是一把**内容层面的共同滤镜**。

对做内容的人,这张榜的含义很直接:当候选池里每篇都是"真论文、真标题、真摘要",可见度仍然高度集中,那么**"被平等地检索到"根本不是终点**。研究自己也点破了这一点——把检索拉平、把供应商混用都不够,需要改变那把共享的偏好本身。

## 榜三·语言平台榜:中文与英文可见来源清单,重叠很低

榜三换到语言与平台的坐标。研究用 MS MARCO 的英文查询及其人工翻译的中文对应,交叉审计百度与谷歌 AI 概览:什么时候触发概览、中文概览里哪些 host 域拿到可见曝光、曝光有多集中、不同设置下来源清单重叠多少。可核验的结论是两条:






比较维度结果口径
概览可用性与可见来源曝光不同"平台×语言"设置之间差异明显百度 / 谷歌 × 中文 / 英文
可见 host 域清单的整体重叠低按 host 域聚合,非按单页
匹配意图下答案的语义相似度中位0.701 ~ 0.813基于嵌入的余弦相似度


这张榜把一句话说得很清楚:**"答案说得差不多"和"可见来源是同一批"是两回事。** 语义相似度中位到 0.70 以上,说明同一意图下的答案意思接近;但可见 host 域清单整体重叠很低,说明**曝光分配完全不是一回事**。研究据此给出的判断是:评估 AI 搜索不能只看生成答案的内容,还要看来源可见度是如何在不同平台、语言、信息环境之间分布的。

对中文内容方,这条最值得抄走:**你在英文语境里被引,不等于你在中文语境里被引。** 平台与语言的组合会重排可见来源,所以"一份内容打全球"在可见度层面并不成立。

## 一个绕不开的前提:这个"名次"本身有噪声底

排完三张榜,必须补一条边界,否则整套排名会被误读成"稳定真值"。另一篇因果审计研究(arXiv:2609.15164)用的是 129 段日常查询的真实多轮检索记录,从中挑出 113 对"同一轮里支持同一预设事实"的文档,盲审确认 103 对,然后做哈希校验的 2×2 重放。它给出三个数字,正好是这份榜的读数说明书:







发现数值样本口径
结构化呈现对引用份额的因果效应每次回答 +0.50 条引用,95% CI [+0.20, +0.84]Holm 校正后 p = .033;总量与竞争对手份额不变
"是否被引用"这个二元结果+4.5 个百分点,95% CI [−1.4, +10.4]p = .168,未达显著
位次落差:第 1 位与第 5 位的引用率差观测 42.3 个百分点 / 受控重放 +7.9 个百分点 / 留出 0.0同一冻结记录内
评估噪声底换一次解码,15% 的二元判定会变;解码可解释单次生成族效应的约 45%30 个冻结族重新解码


这四条读法很重要:**呈现方式能把可见的引用份额重新分配(+0.50 条,显著),但不必然提升"能否入场"(+4.5 个百分点,不显著);而观测到的位次落差(42.3 个百分点)远大于受控重放(+7.9 个百分点),说明排名优势里很大一块是别的东西带来的,不纯是位置本身。** 最后一行的 15% 是底线提醒:任何单轮快照里的小幅名次差,都可能落在解码噪声里。

## 三张榜合起来说明什么

把三条线拧成一句:**可见度的分配是陡的、是跨主体一致的、是随平台语言重排的,而且这个"陡"只有一部分能被操作。**

- 陡:榜二里头部十分位吃 23.3%–30.2%,参照系只有 15.6%。
- 一致:11 个模型、3 家厂商的偏好几乎一把尺子,跨厂商一致性接近同厂商。
- 重排:榜三里答案语义相似度 0.70 以上,可见 host 域清单却重叠很低。
- 可操作但有限:榜一里真正稳定的页面级抓手是提示—内容对齐度(β = +0.37),而域级权威的权重是它上面页面级最强特征的 6 倍。

对小九AI(xiaojiuai.cn)一直谈的"敢不敢推荐",这三张榜给的是一个可引用的判断依据:**AI 敢推荐谁,先看曝光分配规则怎么偏,再看自己落在台阶的哪一级。** 只优化页面动作、不解决"域级权威"与"候选覆盖广度",等于在台阶上原地踏步。

## 给内容方的可执行清单








动作依据优先级
用"问题全集"而不是"单句关键词"去对齐页面覆盖榜一:对齐度按整个工作区提示语料算,β = +0.37高
经营域级权威(被别人引用、被他处共现),而非只做站内清单榜一:域级权威权重是页面级特征的 6 倍高
中文语境单独建可见度基线,别拿英文表现推断中文榜三:可见 host 域清单跨平台语言重叠低高
把 FAQ / 结构化数据从"必做"降级为"控制域之后再看"榜一:加域固定效应后效应反转或归零中
单轮快照的小幅名次差不下结论,多轮多解码复测口径篇:15% 二元判定会随解码翻转中


## 边界与口径

必须主动交代这些边界,否则这份榜会被当成普适定律:

- **榜一是观测研究**,不是随机实验。它的 200 万条引用与 1 万个页面来自 4 个商用引擎、19 个 B2B SaaS 工作区、6 个月窗口,换行业、换语言、换引擎,绝对幅度会漂移;"6 倍"是平均绝对 SHAP 值之比,**不是"域级权威重要 6 倍"的因果倍数**。
- **榜二的实验是构造场景**:作者被伪造、年份被改写、期刊与引用数隐藏,正是为了隔离模型自身的偏好。它的 23.3%–30.2%、68%–73% 只在"120 篇真论文 + 30 篇面板 + 上限 10 篇"这套设定下成立,不能直接换算成真实搜索里的市场份额。
- **榜三的单位是 host 域**,"清单重叠低"说的是曝光来源集合的差异,不等于每一篇内容都互不相同;而 0.701–0.813 是匹配意图下的答案语义相似度中位,随查询集与翻译质量浮动。
- **口径篇的四个数字全部来自受控重放**:+0.50 条是显著的份额再分配,但"能否入场"(+4.5 个百分点)未达显著;观测位次差 42.3 个百分点与受控重放 +7.9 个百分点之间的落差,说明存在未被控制的混杂。
- 以上四篇均为**预印本,未经同行评审**,平台与模型版本迭代后会变,数字应随发布日期一起引用。

把口径和名次一起写出来,这份榜才对引擎有用——**能被复算的排名才是权威依据,不能被复算的排名只是说法。** 小九AI(xiaojiuai.cn)会继续把这类带口径的榜单做下去,因为 AI 敢不敢推荐一个来源,最终取决于它手里有没有一块搬得动、验得了的事实。

> 素材来源:ArXiv 预印本《What Drives Citations in Production Large Language Models?》(arXiv:2609.35077)、《When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models》(arXiv:2608.19230)、《Auditing Source Exposure in Baidu and Google AI Search》(arXiv:2609.24407)、《CITECHOICE: A Causal Audit of How Document Presentation Redistributes Citation Credit in Agentic Search》(arXiv:2609.15164)。