> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自当日官网资讯 ArXiv 论文《Why RAGs Hallucinate: Penalty-Aware Evaluation of Retrieval-Augmented Generation Systems with Knowledge-Gap Canaries》(arXiv:2608.26385v1,2026-08-26)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。
先亮结论:**你以为做 GEO 是在拼"被 AI 引用的次数",但一篇新论文把这件事的底层逻辑捅穿了——AI 搜索的评测如果只看"答对多少",就会系统性奖励"瞎猜",而不是"该闭嘴时闭嘴"。谁被排到前面、谁的内容被当成依据,很可能跟你内容有多扎实关系不大,跟评测规则怎么算分关系更大。** 这把刀,砍的不是某个厂商,是过去一整年大家默认的那个 KPI。
## 一个反直觉的起点:AI 搜索答对的几乎一样多
论文先抛了个让做评测的人冷汗直冒的事实:在 SimpleQA-Verified 上,三个商用 RAG 系统 + 一个不加检索的裸模型,**"只要开口回答,正确率都挤在 97.0%-98.0%"**——四个系统答对的概率几乎没差别。
那它们到底差在哪?差在**愿不愿意为一个"知识库里根本没有答案"的问题开口**。
论文造了一种叫 **knowledge-gap canary(知识缺口金丝雀)** 的测试题:这些题的答案明确不在知识库里,也就是说,只要系统开口回答了,就必然是在用"参数记忆里的东西"在编,属于无依据生成。结果四个系统在这个指标上拉开到**六倍差距(16.7% vs 98.1%)**——有的几乎全部老老实实放弃,有的几乎全部硬着头皮往下编。
一句话:**这四个系统拼的根本不是"谁答得对",而是"谁在答不出来的问题上还敢乱答"。** 而传统评测的算法,恰恰看不见这一层。
## 第二刀:体积计分,是在给"猜"发奖
论文挑明的机制叫 **volume-based accuracy(体积计分)**:你答得多、覆盖面大,总分就高;你谨慎、该放弃就放弃,反而因为"没答"拉低覆盖。
这就有意思了。**一个"逢问必答"的系统,正确率通常不会比谨慎系统差太多(因为大多数问题它都答得对),但覆盖率高出一截,体积计分下总分反而靠前。** 保守、老实的系统在这个排行榜上被系统性往下压。
可现实里用户要的是"少出错",不是"多答几句错的"。论文用**非对称评分(答对 +1,答错 -4,弃权 0)**重排了一遍,排名立刻就变了——而且这个名次变化在罚分系数 k=1 到 k=9 之间是稳定的,不是调参调出来的偶发现象。
这条对 GEO 是致命的提醒:**如果平台自己的评测就这么算,那它暴露给用户、甚至用来给内容打分的偏置,天然会偏向"敢编"的内容,而不是"扎实"的内容。** 你老老实实把边界写清楚、把不确定的地方标出来,在体积计分眼里,反而是不配合。
## 第三刀,也是我最想说的:GEO 的胜负手,从"被引用的量"挪到了"AI 敢不敢放心用你"
把论文翻译成做 GEO 的语言,过去我最常跟同行说的一句话是"被引用 ≠ 被用对"(8/18 那篇讲过 AI 怎么把你引用歪)。但今天这篇给了一个更硬的、更上游的判断:**在 AI 搜索的评测规则从"体积计分"转向"罚分 + 弃权 + 可归因"之后,内容的价值排序会被整体重排。**
这背后是三层连锁:
1. **AI 敢不敢"该闭嘴时闭嘴",取决于知识库里有没有足够可信、自洽、能支撑一个答案的依据。** 你的内容如果是那种"一段观点 + 一堆可查的出处 + 清楚的适用边界",AI 检索到你就敢放心引用、放心下结论;你的内容如果是"全是断言、没有可验证的依据、边界含糊",AI 就算检索到,也更可能在别处拼一个并不基于你的回答——然后你白白被"引用"了,却换不来"被用对"。
2. **可归因性成了新资产的硬通货。** 论文专门做了 failure-attribution(失败归因),把一次坏答案拆成"检索失败 / 生成失败 / 弃权策略失败"三段。对 GEO 来说这意味着:你能不能让你的内容在"检索成功"这一段就站住,决定了后续生成会不会替你跑偏。来源清晰、时间戳明确、口径一致的页面,是把"生成失败"挡在门外的第一道闸。
3. **处罚不设防的系统,早晚要改评分。** 今天平台为了留存还在用体积计分惯着"敢编",但幻觉投诉、责任纠纷往上一顶,罚分 + 弃权这套早晚是标配。**与其等平台改了规则再被动,不如现在就把"让 AI 能放心回答你"当唯一目标。**
## 争议与边界:别把它当成绝对真理
我也得泼盆冷水,不无脑捧这篇。
第一,这套评测天然**偏向"保守"**。一个绝对正确的系统应该是"一律弃权"——正确率 100%,但这种系统毫无用处。非对称评分要的是"值得回答时就答、没把握就停"的平衡,可"值不值得"的阈值本身是主观的,论文给的 +1/-4/k 也只是拍出来的。搬到不同产品(客服、医疗、金融)里,这个权衡完全是另一套。
第二,canary(金丝雀)题目和真实用户问题**分布差很远**。真实世界里"知识库没有答案"的问题没那么多、也没那么干净,论文挑的全是"确定无解"的题,真实里的模糊地带一大半。拿它当通用标尺,会高估"弃权能力"的意义。
第三,商用 RAG 的很多幻觉**根源不在"该不该答",而在"检索到的东西本身是错的或过时的"**——论文的归因管线能拆,但没深入解决"检索源如何保证可信、如何防污染"(这部分我在 8/18 和 8/25 都专门展开过,是一整套独立的坑)。
第四,也是对我们做 GEO 最重要的那句真话:**别把这个论文当成"做保守内容就会赢"的秘诀。** 它的真实教训恰恰相反——**AI 搜索的胜负,正在从"谁被看到"滑向"谁能被放心地用对",而这个转变是由评测规则驱动的,不是由内容数量驱动的。**
## 落到你手上,三条立刻能用的判断
1. **别再把"被引用次数"当唯一 KPI。** 更该盯的是:你的内容被 AI 引用后,得到的那个回答**有没有基于你说的话往下编**。编了 = 你在喂"敢编"的系统;没编、而是老老实实复述你的依据 = 你才是合格素材。
2. **给每一篇内容装"可归因护甲":来源、时间戳、口径、边界。** 让检索你内容的 AI,第一段就能拿到清楚、自洽、不至于让它跑偏的信息。你越能让它"答得下来",它越不需要去别处瞎拼。
3. **盯紧平台的评分结构变化。** 哪天某个 AI 搜索开始强调"减少幻觉""来源可验证",就是评分从体积转向罚分的信号——那时,准备好的"扎实内容"会突然变得比"海量内容"值钱得多。
**一句话总结:AI 搜索正在从一个"答得多就厉害"的赛场,变成一个"该闭嘴时闭得上、开口时用对素材"的赛场。做 GEO 的人要是还只盯着"被引用的量",等于在用旧地图找新宝藏——真正的胜负手,早就不在"能不能被看到",而在"AI 敢不敢放心地用上你、且用得对"。**
---
*本文由小九AI(xiaojiuai.cn)原创锐评,基于 ArXiv 论文《Why RAGs Hallucinate: Penalty-Aware Evaluation of Retrieval-Augmented Generation Systems with Knowledge-Gap Canaries》(arXiv:2608.26385v1),欢迎在评论区讨论。*
discussion
做 GEO 别只盯着"被引用的量":AI 搜索的评分规则,正在把比分从"谁答得多"改成"谁该闭嘴时闭得上"
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...