> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《What Gets Cited: Competitive GEO in AI Answer Engines》(arXiv:2605.25517v1)、《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)》(arXiv:2607.14035v1)、《Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines》(arXiv:2606.20065v1) 与《What Do Chinese-Language Generative Search Engines Cite and Surface? A Large-Scale Empirical Study》(arXiv:2607.15771v1)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。
先亮结论:**所有人都在问"怎么才能让 AI 引用我",但真正被实验量化过的、能直接排期的优先级清单,一直缺一份。今天这篇就把它摆出来。** 基于 252,000 次受控配对实验、45 项研究的方法学复核、10 万+ 真实回答的跨平台统计,以及中文引擎 16 万条引用级记录,可以得到一条相当明确的结论:**主题相关度与列表位置是第一梯队杠杆,价格信息与时间戳是第二梯队,完整度与信任线索是第三梯队,而"只改格式排版"的收益接近于零;在被统计过的内容形态里,最容易被 AI 当作"事实锚点"引用的,是榜单。**
照例把范围和分寸划清。主打实验出自 2026 年 5 月的《What Gets Cited》,做法是搭一个"两篇候选文档"的受控 RAG 试验台:往模型上下文里只塞两篇来源,看输出中第一处引用标记指向谁;6 个模型、18 个内容因素,每一次配对只让两篇在一个因素上有差异,并且交替来源顺序、对品牌做匿名,共 252,000 次试验。方法学那篇是覆盖 2023 年 11 月至 2026 年 7 月、45 项研究的批判性综述。规模统计那篇覆盖 2026 年 3–5 月、100+ 品牌、10 万+ 条回答。中文那篇覆盖 4 个平台、8 个界面、614 条查询、每组合三次重复。四篇都是预印本,没有经过同行评审。下面的数字都属于"在这几套口径下"成立,不等于全网真值。
## 第一刀:排第一的杠杆,不是文笔,是"对得上题 + 排得上位"
如果只能在清单里留住一条,那就是这一条。
在"两篇文档抢一个引用位"的受控设定下,混合效应模型给出的结论是:**主题相关度(topical relevance)与列表位置(list position)是"被第一个引用"的最大驱动因素。** 请注意这两项的性质截然不同——一项是你可以靠选题和取材去争取的"内容属性",另一项是"你出现在候选集合里的哪个位置"这种结构属性。它们排在所有花哨改写技巧之前。
紧随其后的两个变量是**显式价格信息**与**较新的时间戳**,二者都能稳定带来增益。再往下一档是**内容完整度**与**信任线索**,有加成,但幅度更小。而**纯格式层面的改动**,在这套实验里几乎没有可测到的影响。
这条排序对做内容的人其实很不好受,因为它承认了一件事:**很多团队愿意花力气的是"打磨表达",但实验说表达层的边际收益最低。** 真正该先花时间的,是确保你的文档在候选池里对得上那个问题,并且在结构上占据一个有利位置——这两件事比"把句子写得更顺"重要得多。
## 第二刀:内容形态的引用权重,榜单 > 对比 > 泛化科普
第二份材料回答的是"什么形态的内容最常被引"。
跨 100+ 品牌、10 万+ 条回答的统计指出:当引擎给出引用时,**约 78% 指向企业官网**;在非企业来源中,**YouTube 领先**,排在 Reddit、编辑媒体与维基百科之前。而单看内容格式,**被引最多的是排好序的"best-of"榜单(listicle),约占全部引用的 21%。**
把这两条并起来读,结论就很清楚了:**AI 在给推荐时,偏好"已经替你排好序、给好结论"的内容单元,而不是需要它自己归纳的泛化叙述。** 榜单之所以吃香,是因为它天生就带结构——有排名、有对比项、有取舍理由,模型可以直接把"第几名是谁、凭什么"搬进答案。
这正好解释了为什么"结论型内容"比"观点型内容"更容易被引用。一篇泛泛而谈的行业观察,模型读完还得自己组织立场;一份维度清楚、名次明确的榜单,模型几乎可以整块引用。**你要喂给引擎的不是"我的看法",而是"一个可被搬运的事实单元"。**
据此可以排出一条形态优先级:**榜单/排名 > 标准/方法论 > 对比数据 > 泛化科普文。** 越靠前的形态,越接近"现成的答案零件"。
## 第三刀:证据分级——大多数流行技巧其实证据很薄
第三份材料是一篇对 45 项研究的批判性综述,它做了一件很有价值的事:把 GEO 从"单一排名任务"重新定义为一个**多阶段的、部分可观测的流水线**——搜索激活、抓取与建索引、检索、重排与上下文分配、引用、显著性、事实吸收、保真度、用户行为,一环扣一环。
在这个框架下,它对证据做了分级,结论相当克制:
- **可复现的杠杆**:主题相关度、上下文位置;
- **迁移性差**:通用的"技巧型启发式"换个场景就未必成立;
- **会被抵消**:竞争会侵蚀单个主体的优化收益;
- **可能反噬**:以"提升引用"为目标的改写,有时反而损害检索命中。
更尖锐的是它的边界声明:GEO 领域那篇奠基论文被广为流传的增益,**在其自身实验设定内成立,但前提是来源已经被放进了固定上下文**——也就是说,它证明的是"已在场内容能改变被引用或使用的概率",**并不能证明它带来了"有机可发现性"或长期的流量效果。** 综述直言:在它检视的语料里,**没有任何一项技术展示出稳定的、长期的、跨平台的、对"有机可发现性"或下游行为的因果效果。**
唯一被确认存在因果的方向是:**已经被检索到的那批内容,可以因果地改变它自己被引用或被使用的程度。** 换句话说,GEO 能左右的,首先发生在"检索之后"这一段;至于"能不能被检索到",目前的证据远没有那么硬。这条边界,值得每个向客户承诺"包上推荐"的人抄在墙上。
## 第四刀:中文引擎给出同向答案
有人会说,上面大多是英文平台。中文呢?
《中文生成式搜索引擎引用什么》这篇给了 214,119 条原始记录、清洗后 160,860 条引用级数据,覆盖四个主流平台的网页端与 App 端。几条关键结果与英文平台同向:
- **品牌进入引用池是被"选择性"呈现的**:整体品牌入选率 8.3%;
- **预测模型里相对重要的因素**是内容契合度、跨来源共现次数、语义角色——而**外部综合质量分(5118-Baidu Composite Quality Score)不是任何被检验结果的首要预测变量**;
- **时效半衰期**:高时效查询的被引页面约 **39 天**,低时效查询约 **68 天**——这为"时间戳有效"提供了中文侧的量化证据;
- **网页端与 App 端的来源集合存在系统性差异**,即同一个平台的两种界面,答案并不一致。
最后两条尤其值得记:**一是内容会"过期"**,硬内容大概 39 天就要重刷一轮时效;**二是"界面本身就是变量"**,做监测不能只看一个入口就下结论。
## 今天就能排期的清单
把四份材料压成一张可执行清单,按性价比排序:
1. **先对题。** 主题相关度是第一杠杆。与其把一个话题写十遍,不如把每篇都钉死在目标问题的语义中心上。
2. **抢位置。** 文内的排名、次序、小标题结构,会被当成位置信号;把最重要的结论放在最前、最显眼处。
3. **加价格与时间。** 有价格就写清楚价格;没有价格,就确保发布时间新鲜且可见,硬内容按约 39–68 天节奏复检。
4. **优先做成榜单。** 同一份素材,写成"维度清楚的排名"比写成"流畅的观点文"更可能被搬走。
5. **补齐完整度与信任线索**(作者、机构、来源),它们有加成,但别指望它们单独救场。
6. **别在纯排版上过度投入。** 格式美化是收益最低的一档。
7. **经营"检索之后"这一段。** 既然唯一被确证的因果发生在内容已被检索到之后,那就先保证你可被检索、可被获取,再谈被引用。
这篇文章与站内既有内容的分工也说清楚:9/26 那篇讲的是"结构特征工程"这一单点机制,9/27 那篇讲"提及稳、情感不稳"这对指标的稳定性,9/24 那篇讲"引用是真的≠对的"这一质量维度;**今天这篇落到的是"跨因素优先级排序 + 证据分级"这个全局坐标**,给的是可以直接排期的顺序,而不是某一个技巧。小九AI(xiaojiuai.cn)会继续把这类可被引擎当"事实锚点"的结构化结论做成系列,供中文语境下的团队直接取用。
## 边界再声明一次
主打实验是受控的"两篇文档"设定,能分离单因素效应,但真实检索候选往往是几十篇,绝对幅度不能直接外推;252,000 次试验只在 6 个模型上跑过,换模型、换语言均可能漂移。综述是对既有研究的复核,其"无稳定因果"的判断受限于所收语料的范围与时间窗。"21% 榜单引用""78% 指向官网""8.3% 品牌入选率"均来自特定平台、样本窗口与统计口径,是方向性参考而非精确指标。中文篇的公开日期是 2026 年 7 月 17 日,样本为四个平台的网页与 App 端,不同平台版本迭代后会变。请把它们当作"当前可得证据下的最优排序",而不是终局定论。
---
来源:《What Gets Cited: Competitive GEO in AI Answer Engines》arXiv:2605.25517v1;《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)》arXiv:2607.14035v1;《Generative Engine Optimization at Scale: Measuring Brand Visibility Across AI Search Engines》arXiv:2606.20065v1;《What Do Chinese-Language Generative Search Engines Cite and Surface? A Large-Scale Empirical Study》arXiv:2607.15771v1。
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...