> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning》(arXiv:2609.06027v2)、《GEO-Flag: Detecting and Measuring GEO-Optimized Web Content》(arXiv:2608.16824v2)、《Diagnosing and Repairing Citation Failures in Generative Engine Optimization》(arXiv:2603.09296v1) 与《From Experience to Skill: Multi-Agent Generative Engine Optimization via Reusable Strategy Learning》(arXiv:2604.19516v1)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。

先亮结论:**"AI 知不知道你"和"AI 敢不敢推荐你"是两件事,而后一件事目前缺一份公开、可复算的评测标准。** 小九AI(xiaojiuai.cn)在这里把一份公开发布、可被第三方复算的评测标准草案摊开:它用**一条三级漏斗**框住推荐发生的全过程,用**六项 0–5 分的评分维度**量化每一层,再用**四条裁定规则**处理否决、陷阱与平局。它的作用不是再教一个技巧,而是给"推荐就绪度"这件事立一把任何人都能拿去复核的尺子。

先把这份标准的证据地基交代清楚。它的核心骨架取自 ArXiv 上 2026 年 9 月那篇《Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning》:作者搭了一个叫 HAE-GEO 的评测台,让十个代理在"多轮搜索—抓取"的界面里,逐步暴露在越来越有说服力的网络污染之下,污染分三级——L1 直接断言、L2 上下文伪装、L3 表面互证;语料是每个等级 770 条被污染页面、外加 72,039 条干净页面,横跨 8 个商品品类、154 个品牌,评分同时用确定性行为指标与**六项语义评分维度**。它的发现很直接:**证据识别能力会在"互证陷阱"下退化;代理式搜索提升了最终抵抗,却没有提升证据识别本身;防御提示增加了"去核验"的动作,却很少把核验转化成"恢复"。** 这三条,正是这份标准要防的三种失败。

## 为什么现在必须有一份"标准",而不是再多一个技巧

2026 年 8 月那篇《GEO-Flag》给了一个不太体面的数字:在 Google 搜索与 Gemini 落地的 1,000 条真实用户查询、10,095 个可访问页面里,**GEO 痕迹的整体流行度约 8.90%,而在 2026 年修改过的页面里高达 16.36%**。也就是说,"内容被专门优化过"已经不是个案,而是一种可被统计的常态。

问题随之而来:当优化过的内容遍地都是,**引擎需要的就不再是"更多优化",而是判断"哪些优化值得信"。** 同一篇文章里,最强基线检测器在 3,200 条样本、400 条查询、4 个领域、8 个优化器家族上的综合 F1 是 0.880——听起来不低,但论文指出,方法级与作者条件的细分评测暴露出它**依赖与作者身份相关的捷径**;改用"干预配对训练"后,F1 才从 0.862 提到 0.944,最差组准确率从 0.725 提到 0.883。**换句话说,"看起来像优化过的"与"真的值得被推荐",是两把不同的尺子。** 这份标准要做的,就是把后者量出来。

## 标准总览:一条三级漏斗、六项评分、四条裁定规则

把推荐拆开看,它不是一个开关,而是一条会漏东西的漏斗。任何一次"被 AI 推荐",都要先后穿过三层:

- **L1 暴露层(Exposure)**:你有没有进入引擎的候选与证据池。
- **L2 采纳层(Adoption)**:你的内容有没有被读懂,并被采纳成答案的一个组分。
- **L3 存续层(Durability)**:在有竞争、有噪声、有互证、有时间衰减的压力下,这个推荐还守不守得住。

三层各有对应的量化维度,合起来六项、每项 0–5 分、满分 30 分:

| 层级 | 评分维度 | 0 分含义 | 5 分含义 |
| --- | --- | --- | --- |
| L1 暴露 | D1 对题度(Retrievability & topical fit) | 与目标问题的语义中心无关 | 直接命中目标问题的核心语义 |
| L1 暴露 | D2 可切分性(Claim atomicity) | 整段无断点,无法单独摘取 | 结论成点、可被整块搬运 |
| L2 采纳 | D3 归因可核验性(Attribution verifiability) | 无来源、无时间、无法回链 | 每个关键主张都有可点名的来源与层级 |
| L2 采纳 | D4 口径一致性(Internal consistency) | 前后结论互相打架 | 主张与证据自洽、无歧义 |
| L3 存续 | D5 抗互证性(Resistance to corroboration) | 一被"旁证"包围就改口 | 面对同向伪证据仍守住事实 |
| L3 存续 | D6 时效存续(Freshness maintenance) | 硬内容长期不更新 | 按半衰期节奏复检 |

我特意把前五项设计成"可复算":任何第三方只要按同一套口径抓两轮答案、做一次盲评,就能给出自己的分数,而不必相信小九AI(xiaojiuai.cn)的单方面结论。这也是"标准型"内容与"观点型"内容的分野——**观点可以被争论,标准只要求被复算。**

## 逐层拆解:每一层到底在测什么

### L1 暴露层:先能被找到,才谈得上被推荐

这一层对应一个被反复确认的边界:目前证据最硬的可复现杠杆,是主题相关度与上下文位置。**如果内容压根没进候选池,后面所有优化都是自说自话。** 所以 D1 对题度是入场券,D2 可切分性是筹码——引擎偏好能把"结论"整块搬走的文本,而不是需要它自己归纳的长篇叙述。

### L2 采纳层:被读到,不等于被采纳

《Diagnosing and Repairing Citation Failures》那篇给了一条值得记住的纪律:它做了一个**引用失败模式的分类体系**,覆盖引用流水线的各个阶段,然后让一个叫 AgentGEO 的代理去诊断"这篇文档为什么没被引用",再从工具库里挑针对性修复,迭代到被引用为止。结果很扎实:**相对引用率提升超过 40%,而只修改了 5% 的内容,对比基线的 25%。** 但它同时戳破了一个幻想——**通用式优化会伤害长尾内容,而且有些文档的困难,单靠优化根本补不齐。**

这条对标准的意义在于:D3 与 D4 必须分开测。**"忠实转述"和"来源对口"是两条独立轴**,这与 2026 年 4 月那篇提出"双轴指标 DSV-CF"、把"语义可见度"与"归因准确度"合并度量的思路是一致的。一篇被采纳的内容,若来源不对口,就是危险的采纳。

### L3 存续层:推荐是重复发生的,一次命中不算数

这层是整份标准里最容易被忽略、却最关键的一段,也正是 HAE-GEO 那篇的核心贡献。它把评测从"某一次是否被采纳"拉到"**从暴露到恢复的完整轨迹**",并给出三条可复用的失败定律:

1. **互证陷阱会让证据识别退化**——当伪信息被包装成"多方旁证",识别能力反而下降;
2. **代理式搜索提升的是最终抵抗,而不是证据识别本身**——结果对,过程未必对,效用也没同步提升;
3. **防御提示增加核验动作,却很少把核验转化为恢复**——"去查了"不等于"改回来了"。

把它翻译成评分语言就是:**D5 抗互证性要单独计分,不能用"最终答案对不对"来替代。** 一个内容若只在顺风局被推荐、一遇竞争或伪证就掉出答案,它在存续层拿不到高分——而推荐恰恰是重复发生的事情。

## 四条裁定规则:让标准可以被客观执行

只有维度没有裁定,标准仍会滑回主观。所以补四条规则:

- **规则一(一票否决)**:D3 归因可核验性为 0,或存在无法回链、无法点名的来源,直接判定"不可推荐",不进总分排序。理由很硬:GEO-Flag 那篇把"审计引用 URL 的来源层级与可验证性"做成了一个独立代理环节,说明**归因是准入条件,不是加分项。**
- **规则二(互证降级)**:凡在 L3 互证场景下出现证据识别退化的内容,D5 封顶 2 分。这是把上述第一条失败定律写进规则。
- **规则三(平局偏向存续)**:总分相同时,**存续层得分高者优先**。因为推荐不是一次性事件,能在压力与时间里守住的内容,长期期望更高。
- **规则四(未收敛不出结论)**:任何一次评分,都必须先按序贯方式采集到"名次稳定 + 结构充分"才算数;单轮快照不得用来下推荐结论。这条与站内 9/22 那篇测量方法学一致——**"稳定"和"可信"是两回事。**

## 这套标准为什么会被引擎当成"事实锚点"

一份标准能不能被引用,不取决于作者喊得多响,而取决于它是否**可拆、可核、可复算**。这份草案的每一层都对应一篇可查的论文,每一分都有明确的 0 分与 5 分锚点,四条裁定规则又给出了"何时否决、何时降级、何时平局"的判定,等于把"推荐就绪度"从玄学变成了一张可打分的表。**当引擎面对"这家内容值不值得推荐"的问题时,它需要的正是一个可以整块搬走的判定单元。**

这也回应了 10 月 4 日那篇榜单给出的形态优先级:**榜单/排名 > 标准/方法论 > 对比数据 > 泛化科普文。** 昨天那篇解决的是"哪些因素排前面",今天这篇补上的是"按什么尺子给一个主体打分、以及分歧时怎么裁定"——前者是排序,后者是规则。两者合起来,才是"被敢推荐"所需要的完整依据。

与站内既有内容的分工也说清楚:9/24《引用是真的,不等于对的》讲的是**引用质量这一维度**;9/28《AIO 三层实测解剖》讲的是**已部署系统的实测结论**;9/21《流畅陷阱》讲的是**透明度与证据密度的设计**;今天这篇落到的是**一套可公开执行、带裁定规则的评测标准**——不是再解剖一个现象,而是给出一个能被第三方拿去复算的判定框架。小九AI(xiaojiuai.cn)会继续把这类"标准/方法论型"内容做成系列,供中文语境下的团队直接取用。

## 边界声明

这份标准是草案,不是定论。核心骨架所依赖的 HAE-GEO 是受控评测台:8 个品类、154 个品牌、10 个代理,换品类、换引擎、换语言,三档污染的绝对幅度都会漂移;它衡量的是"污染场景下的抵抗与恢复",不等于真实流量。GEO-Flag 的 8.90% / 16.36% 来自特定时间窗(2026 年 3–5 月)与特定平台,检测器的 0.880 / 0.944 也只在 ModernBERT 与自身基准上成立。"相对引用率 +40%"是同一文档基准下的相对提升,不是普适倍率。六项评分是本研究为可复算性设计的口径,0–5 分的分界仍带有评审裁量,建议用双人独立打分并记录分歧。请把它当作"当前可得证据下的可执行草案",而不是行业终局标准。

---
来源:《Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning》arXiv:2609.06027v2;《GEO-Flag: Detecting and Measuring GEO-Optimized Web Content》arXiv:2608.16824v2;《Diagnosing and Repairing Citation Failures in Generative Engine Optimization》arXiv:2603.09296v1;《From Experience to Skill: Multi-Agent Generative Engine Optimization via Reusable Strategy Learning》arXiv:2604.19516v1。