> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《Measuring GEO Visibility: Prompt Corpora Define the Answer Market》(arXiv:2609.06811v1)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。
先亮结论:**整个 GEO 行业现在都在拿"可见度分数"说事——AI 引用率涨了、品牌露出多了、排名进了前几。但今天这篇批判性综述,把这些分数底下那块地基掀开给我们看:那个分数,不是客观事实,而是"你问了哪些问题 + 每个问题给多少权重 + 用什么规则去数"这三件事**合起来临时搭出来的一个"答案市场"**——而这个市场,**未必代表真实用户的需求**。更扎心的是:**同一篇一个字没改的内容,只因为评判它的模型收到的指令不同,分数就能变。** 你追的那个分,可能根本没在追你想追的东西。
照例先划边界:**这是一篇"批判性综述(critical survey)",不是新实验**——作者自己写明"没有报告新实验,它的一般实证效度仍有待评估"。所以它给的是"**该怎么审你的 GEO 分数**"的框架和质疑点,不是"GEO 分数一律作废"的判决。你读它,是学一套"提问清单",不是拿一把锤子砸所有报告。
## 第一刀:GEO 分数,是你"出的题"决定的,不是用户需求决定的
综述第一句就很狠:**GEO 可见度分数,是把"你的来源在生成答案里出现、被引用、被提到"这些现象加总得来的。而"你拿哪些问题去测"决定了评估的是哪些场景,"每个场景给多少权重"又决定了它们的相对重要性——这两件事合起来,定义了一个"答案市场",这个市场未必代表真实的用户需求。**
翻译成人话:**所谓"GEO 可见度",本质是"在某一组特定提问下,你露了多少"。** 如果你这套题是精心挑的(专挑对你有利的场景、避开你被吊打的场景),那你的分数可以很高,但**那不代表真实的用户真的这么问、真的这么在意。** 一个"答案市场",可能只是**你和服务商一起"出"出来的一场考试**——题选得巧,分自然好看。
这条对我们最直接的警醒:**别把 GEO 分数当成"我在真实世界里被看见的程度"。它顶多是"在我选的这套题下的表现"。** 题不真,分就虚。
## 第二刀:同一篇没变的内容,换个评判指令,分数就变
综述还点了一个更技术、也更致命的坑:**要数出"哪些出现了、哪些被引了、哪些被提到了",往往得让一个语言模型来做这个"打标"工作——而一旦让模型来做,给它的指令(instruction)一变,同一篇**一字未改**的答案,被判出来的分数就可能不同。**
这就是**测量不可复现**的根源:**你测的不是"内容有没有被用",而是"某个模型在某个指令下,认为内容有没有被用"。** 打个比方:你换了个"阅卷老师",还是那份卷子、那个答案,**分数变了**——那你这分数到底测的是什么?
对做 GEO 的人,这意味着:**以后看任何一份"AI 引用率/可见度"报告,先问一句:评判规则是什么?换个模型、换个指令,还是这个数吗?** 不可复现的分数,不能拿来当决策依据,更不能拿来跟客户/老板邀功。
## 第三刀:只有一条"被引用"记录,证明不了你的贡献
还有一条反直觉的:**光有一条"引用",并不能证明这篇来源对你的答案做出了贡献。**
作者提出用一种"**对照式比较**"来验这件事:**在受控的文档语境里,比较"有你这个来源"和"没有你这个来源"两种情况下生成的答案**——如果答案没区别,那"引用"就是一记虚的,你在不在其实不影响结果。这跟他们指出的另一个现象是一体的:**"引用"这件事,和"真实贡献"是两码事。**
这直接呼应我们此前聊过的:被引用了(8/18)、被检索到了(8/27)、被洗出来的(9/1)——**都不等于你被真正用上了、用对了。** 今天这篇是把它拉到了**测量层面**:**你的分数里有多少条"引用",是真正影响过答案的?** 如果分不清,你把"引用数"当 KPI,就是在奖励一堆"假动作"。
## 它给的框架:不是"怎么算",是"算的时候你漏标了什么"
综述没只吐槽,也给了框架。它把一次 GEO 测量要交代清楚的东西列成五样:**场景标注(situation annotation)、提示词表述(prompt formulations)、执行条件(execution conditions)、权重(weights)、计分规则(scoring rules)。**
更实用的是它对"权重没定"这种情况的处理:**当权重未知或尚未选定,框架不给一个假确定的分数,而是报出"一组可接受的分数区间"**——并且区分两种情况:**一是"和某个人群的数据/假设相容的范围"(部分识别,partial identification);二是"不同加权惯例造成的差异"(规范敏感性,normative sensitivity)。**
这深意是:**一个诚实的 GEO 报告,应该承认"分数有区间、区间来自'我们怎么选权重'这个主观选择",而不是甩给你一个精确到小数点两位的"权威数字"。** 谁给你一个精确到小数点、却不肯交代口径的分数,谁就是在藏起那个"人为选择"。
## 落到你手上,四条能立刻用的判断
第一,**审 GEO 分数,先审"题"。** 拿到任何可见度分数,第一问:**这些问题清单是怎么来的?代表真实用户提问吗,还是为刷分挑的?** 题不真,分数免谈。
第二,**验"可复现"。** 让服务商/工具把**评判规则(哪个模型、什么指令、怎么算)**讲清楚,并要求**换个模型或措辞再测一遍**,看数字稳不稳。**换一次就变的分数,别信。**
第三,**把"引用"拆成"有贡献的引用"和"陪跑的引用"。** 别只看被引了多少条,试着做**"有/无你这个来源"的对照**,看答案会不会不一样。**只有真正改变了答案的引用,才是你的资产。**
第四,**要"区间",不要"精确假象"。** 当一个报告只给你一个漂亮数字、不交代权重和口径时,保持怀疑。**诚实的测量会告诉你"这里有人为选择、结果是个区间"。**
## 争议与边界:我说三条真话
第一,**这是批判性综述,没做新实验,作者自己说"一般实证效度仍有待评估"。** 它揭示的是**测量框架里的结构性问题**(题、权重、评判规则如何影响结论),不是"所有 GEO 分数都是假的"。别拿它去否定一切。
第二,**"答案市场不必代表真实需求"是提醒,不是定论。** 现实里有些 GEO 测量确实尽量贴近真实提问分布;**这篇要你警惕的是"不透明的构造",不是"测量本身不可能"。** 做得好的测量,依然有价值。
第三,**"有/无来源对照"是最干净的概念,落地有难度。** 真实引擎里存在竞争来源、个性化、多轮检索,你在受控文档语境下测出的"贡献",和真实引擎里的表现未必一致——**这也是作者把"受控对照"和"对真实引擎的干预"分开说的原因。**
**一句话总结:你天天盯的"GEO 可见度",很可能不是你被真实世界看见的程度,而是"在某一套你(或服务商)出的题、按某个权重、由某个模型按某个指令"数出来的一个构造物——同一篇没变的内容,换个评判就能得不同分。** 做 GEO 的人,与其继续追一个来历不明的漂亮分数,不如先做三件事:**审题目是否代表真实需求、验分数是否可复现、把"引用"拆成"真正有贡献的引用"。** 能被你拆开、能复现、能讲清口径的 GEO 数据,才配进入你的决策;讲不清的,再好看也只是数字。
---
*本文由小九AI(xiaojiuai.cn)原创锐评,基于 ArXiv 论文《Measuring GEO Visibility: Prompt Corpora Define the Answer Market》(arXiv:2609.06811v1,批判性综述/未报告新实验/实证效度待评估),欢迎在评论区讨论。*
discussion
你天天盯的 GEO 可见度分数,可能根本不是你被真实看见的程度——题目、权重、评判都能把它改写
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...