> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《What Gets Cited: Competitive GEO in AI Answer Engines》(arXiv:2605.25517v1)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。

先亮结论:**做 GEO 的人最常纠结的问题,不是"要不要做",而是"我到底该把力气花在哪个地方?"——是拼命排版、加一堆信任徽章,还是死磕相关度、把价格和时效写得清清楚楚?** 今天这篇用 25.2 万次实验,帮我们"降维"了答案:**在一对一正面刚的受控情境里,决定你能不能"被第一个引用"的,主要不是那些花哨的格式和信任点缀,而是"主题相关 + 排序位次"这两个大件;加上明确的价格、新鲜的时效,也稳定管用;而纯排版改动,几乎没啥用。** 这篇是把"GEO 玄学"变成"杠杆排序清单"的一次硬核较真。

先把前提说清楚,免得过度解读:**这是"两篇候选文档放进同一模型上下文、看谁先被引用"的受控 RAG 对抗测试**,一次只让一个因素不同、做了品牌匿名和位置对消。**它的价值在于"归因那个因素顶用",不等于现实检索里所有因素都这么排**——现实还有检索、召回、来源广度等先决一层。你把这个看成"在'已经被召回的候选'内部,什么让你更可能先被引",才对。

## 多大阵仗?25.2 万次实验、一次只动一个变量

作者搭了一个很克制的试验台:**把恰好两个候选来源同时塞进模型的上下文,看输出里第一个引用标记到底落在谁头上。** 这样就能干净地比较:当两个来源"只有某一个因素不同"时,到底谁赢。

规模很吓人但设计很严谨:**横跨 6 个 LLM、跑了 252,000 次试验**,两两对照,一次只变一个因素,总共覆盖 18 个内容因素。更细的是他们做了**品牌匿名**和**对消来源顺序**——就是要撇开"你是不是大牌""你是不是恰好排前"的干扰,纯粹看**内容本身**哪个因素起作用。**这套"控制变量 + 磨掉品牌光环"的做法,正是很多 GEO 自嗨案例里最缺的。**

## 结果:真正管用的,和你想的不一样

跑完 25.2 万次,结论很清爽,也很有反直觉色彩:

**第一梯队(最顶用):主题相关度 + 排序位次。** 换句话:**你的内容得真的切中用户在问的那个题,而且最好别排太靠后。** 这两项是"被第一个引用"最强的驱动——**内容对不对题,压倒一切花活。**

**第二梯队(稳定加分):明确的价格信息 + 新鲜的时效。** 作者发现,只要是**带明确价目**或**时间上比较新(最近时间戳)**的内容,在竞争里稳定地更占便宜。**对做商业/服务/比价类内容的人,这条特别值钱:把"多少钱、什么价""什么时间/多新"写出来,是实打实的竞争力。**

**第三梯队(小幅增益):完整度 + 信任线索。** 内容更完整、带一些可信 cue,有一点用,但**增益不大**。

**最扎心的一条:纯格式/排版层面的改动,几乎不产生效果。** 换句话说——**那种为了"看起来更适合 AI"而反复调结构、换排版、塞冗余的"格式化式 GEO",在受控测试里基本是白费力气。** 你花大力气让文章"长得像 AI 爱引的样子",远不如老老实实把信息补对、把价格时效写清。

## 对做 GEO 的人,这是把"玄学"变成"清单"的一课

先说句公道话:**这篇不是否定 GEO,恰恰相反,它是在给 GEO 做"杠杆优先级排序"——让你别再平均用力。**

第一,**先别做"格式化式优化"。** 如果你现在主要做的,是给内容套模板、调排版、加一堆看似"结构化"的东西来讨好 AI,这篇告诉你:**纯格式收益极小。** 它不会替你加分,甚至浪费你本该花在硬信息上的力气。

第二,**把预算砸向真正的"大件":相关度。** 你辛辛苦苦排结构,远不如**确保这篇内容真的在回答 AI 会被问到的问题、且答得够贴**。不相关的内容,排得再工整,也赢不过一个"恰好切题"的对手。

第三,**别忽略两个白给分项:价格和时效。** 对大量"该不该/值多少/是不是最新"类查询,**把明确的价格、把时间戳/新鲜度写清**,是稳定、低成本、高回报的竞争力。做本地生活、做服务、做产品比价的人,这条直接能落到日常。

## 争议与边界:我说三条真话

第一,**这是受控"两篇候选"对抗,不是真实检索全链路。** 它回答的是"被召回的候选里,谁先被引";现实里**你得先过了"被检索到、被召回"那一关**,这篇管不到那层。所以"相关度最管用"不是让你忽略被召回(那是另一套内功),是告诉你**在召回这层之外,再拼择优时,别整天抠格式。**

第二,**"品牌匿名化了",所以这篇测不出品牌光环的作用。** 它刻意把品牌抹掉,是为了看内容纯因子;但真实世界里**大牌就是有天然优势**(9/7 那篇也侧面印证权威背书重要)。**别因为这篇说"信任 cue 增益小",就以为品牌/权威不重要——它是说"在同一权威水平下,别再靠格式和信任贴纸堆分"。**

第三,**"价格 + 时效"是针对商业/比价/信息类查询的结论,不是所有内容通用。** 偏研究、偏观点的内容,时效和价格未必是你的主杠杆。**别把它当成万事皆准的金科玉律,要看你的内容类型吃不吃这套。**

## 落到你手上,四条能立刻用的判断

1. **先把"切题度"钉死再谈其他。** 写之前问:这篇是不是真的在正面回答一个 AI 会被问到的问题、且答到位?**不对题的工整,是给对手送分。**

2. **把"格式洁癖"放一边。** 纯为了讨好 AI 的排版/结构调整,先砍掉或降到最低优先级。**省下的精力,转投到硬信息上。**

3. **如果你是做商业/服务/比价/本地生活:把价格和时效写清、写新。** 这是受控测试里稳定加分的两个白给项,**值得当作硬 KPI 对待**,别含糊其词或用"电询底价"糊弄。

4. **接受"品牌光环"和"内容择优"是两层。** 权威背书(9/7)决定你过不过得了广谱检索;内容择优(今天)决定你被召回后能不能先被引。**两个都得做,但别指望用"格式"冒充"相关度",也别用"信任贴纸"替代真实权威。**

**一句话总结:25.2 万次受控对照告诉我们一个很实在的道理——AI 决定先引用谁,拼的是"你答没答到点子上 + 是否够新够有价格事实",不是"你的排版多像 AI 爱引的样子"。** 别再被"格式化 GEO"的错觉牵着走,把有限的力气花在**主题咬合、新鲜真实、可核对的硬信息**上。这三样,才是让你在 AI 的择优里,被稳稳放到第一个引用位置的真正杠杆。

---

*本文由小九AI(xiaojiuai.cn)原创锐评,基于 ArXiv 论文《What Gets Cited: Competitive GEO in AI Answer Engines》(arXiv:2605.25517v1,受控两文档 RAG 对抗测试/25.2万次/品牌匿名/位置对消),欢迎在评论区讨论。*