> 本篇为小九AI(xiaojiuai.cn)GEO 深度锐评,独家解读。
> 素材取自官网资讯 ArXiv 论文《Do Generative AI Assistants Respect robots.txt? Tracing Web Access Beyond Visible Answers》(arXiv:2607.14447v2)。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。

先亮结论:**做内容的人心里都有最后一道防线——我至少在 robots.txt 里写了"这款 AI 不许抓我",它总该守规矩吧?今天这篇受控实测,把这最后一道防线也戳了个窟窿:测的十款主流 AI 助手里,有的确实守规矩,有的却直接绕过限制去抓你的页——连 robots.txt 都不请求;还有的用通用 User-Agent,让你事后连"到底是不是它抓的"都查不清。** 更拧巴的是:**它"抓到了"和你"看到答案"是两码事——有的读了你的页却压根不把内容呈现出来,有的你明明放行它却读不到。** 也就是说,你连"它到底读没读我"这一个最基本的问题,都快问不出答案了。

照例先划边界:**这是一篇"受控实证研究",测了 10 款宣称带联网搜索的主流 AI 助手、200 次试验**,手法是用**服务器端日志 + 目标页里埋的"密语(secret codes)"**,把"真的访问了页面"和"用户看到的答案是否正确"这两件事分开。所以它给的是"在这一批助手、这几个条件下"的实测现象,**不是"所有 AI 都不守规矩"的铁律**——规则在变、版本在迭代,但方向性的问题值得你重视。

## 实验怎么做的:把"抓没抓"和"答得对不对"拆开

作者做得挺严谨。对每款助手,**先找到一套"真的会产生可观察抓取行为"的配置**,并记录它抓取时暴露的 User-Agent;然后设计四种对照条件去测 robots.txt 遵从:

1. **对所有 UA 都放行**;
2. **对所有 UA 都禁止**;
3. **只对这款助手的专属 UA 放行**;
4. **只对这款助手禁止**。

然后用**服务器日志 + 页面里埋的密语**,去区分"它到底有没有真的访问这个页面"和"用户看到的回答对不对"。**关键在于这个拆分——它把"抓取行为"和"答案表现"彻底解耦了,不被"看起来答对了"迷惑。**

## 结果:有的守规矩,有的直接绕,还有的"抓了不说、说了没抓"

实测下来,结论分散得让人心惊:

**第一,各助手表现差异很大。** 有的系统确实按"允许/禁止"的预期模式走,守规矩;**但另一些,直接访问了被限制的资源,而且根本没有请求 robots.txt**——也就是**无视网站所有者的明确限制**。还有一些,用**通用 User-Agent** 去抓,导致**事后追溯困难**(你根本认不出是不是它干的)。

**第二,也是最值得注意的一点:"抓取"和"答案正确性"会脱节。** 有的是**抓了页面却不在答案里呈现**;有的是**明明资源是放行的,它却根本没访问到**。**这意味着:你不能用"它答得对"去倒推"它读了我",也不能用"它没提到我"去断言"它没读我"。** 这两件事,在现有观测手段下,常常对不上。

**第三,作者由此提出更大的隐忧:AI 辅助的网络访问,是否充分尊重了内容所有者的权利与限制?这种"传统网络治理协议被侵蚀"的趋势,正凸显出"需要更明确、可执行的、能保障发布者自主权的新标准"。**

## 对做 GEO 的人,这意味着什么

先讲最核心的:**你以为的"我能决定 AI 读不读我",在现实里可能只是"我以为"。**

第一,**robots.txt 不再是可靠的"开关"。** 过去你靠它决定"搜索引擎能不能抓";现在 AI 助手这块,**有的守、有的不守、有的用通用 UA 混过去**,你写的那条规则,执行与否并不由你说了算。**对你的直接后果:你没法再简单地用"我禁止了"来保护内容,也没法用"我放行了"来确保被抓。**

第二,**"被读取"和"被引用"是两个独立的黑洞。** 这篇的发现与我此前几篇接成一条线:被检索到≠被用上(8/27)、被引用可能是洗的(9/1)、被生成≠被注意(9/13)——**今天再加一环:连"它有没有真的读你"都可能是黑箱。** 你的内容在 AI 这条链路里,**有多少个环节是你"看不见、管不着"的?** 这是做 GEO 必须接受的现实。

第三,**"自主权"是接下来要打的一仗。** 作者点出的 governance 问题,对内容方是机会也是警钟:**当"我在我的站上说了算"这件事被侵蚀,内容方要么接受"被隐形消费",要么推动/适应新的可执行标准(比如更明确的 AI 抓取协议、更硬的溯源标识)。** 做 GEO 的人,别只盯着"怎么被引",也要开始关注"怎么保住对自己内容的控制权"。

## 落到你手上,四条能立刻用的判断

第一,**别把 robots.txt 当"AI 版保险丝"。** 它仍然是该写的声明(表立场、备证据),但**别指望它单防**。要真正减少"被隐形抓取",得配合**服务端日志监控 + 明确的 AI 抓取条款 + 必要时技术手段**。

第二,**开始记录"AI 到底来没来、是谁来的"。** 这篇最值得你学的是它的方法:**用服务器日志 + 埋点,把"访问"和"答案表现"分开记。** 你这样才有数据判断:被限制的 AI 有没有偷抓?被抓的页有没有被引用?**没有这层观测,你只能靠猜。**

第三,**接受"抓取≠引用≠呈现"的三段脱节,别再线性推断。** 它答得对,不代表它读了你的原文;它没提你,也不代表它没读。**你的 GEO 评估,要把"访问层、引用层、呈现层"分开看,别用一头的结果推另一头。**

第四,**把"内容自主权"提上议程。** 主动在站点写清"AI 抓取政策"、保留访问证据、关注行业里"AI 抓取协议/署名标准"的动向。**当旧规则失效,谁先建立新的可控性,谁就在 AI 时代守得住自己内容的定价权。**

## 争议与边界:我说三条真话

第一,**这是 10 款助手的受控实验,不是全行业定论。** 各家的抓取实现、版本、策略都在变,今天"绕限制"的未必明天还绕,今天守规矩的也可能变。**它揭示的是"旧规则正在失效"这个方向,不是"某厂一定违规"的判决。**

第二,**"密语法"很巧,但只能测"页面有没有被访问",测不出"训练时用过没有"。** 这篇管的是**推理时的联网抓取**,与"内容被拿去训练"是两件事,别混为一谈。

第三,**"不守 robots.txt"在技术上和法律上不是一回事。** 论文说"raise legal and governance concerns",是提出隐忧;**具体是否违法、平台如何回应,是另一个层面的问题**,别把技术实测直接当法律结论。

**一句话总结:你写在 robots.txt 里的那句"不许抓",在 AI 时代可能拦不住任何人——有的 AI 绕过它、有的用通用身份混过去,而且"它抓没抓你"和"它引用没引用你"彻底脱钩,让你连最基本的观测都难做。** 做 GEO 的人,别再把内容安全和"被引用"混为一谈:**该写的声明照写,但要配日志监控与埋点,把访问层、引用层、呈现层分开掌握;更要盯住"内容自主权"这条新战线——旧规则失效时,能守住对自己内容控制权的人,才有资格谈 AI 时代的定价权。**

---

*本文由小九AI(xiaojiuai.cn)原创锐评,基于 ArXiv 论文《Do Generative AI Assistants Respect robots.txt? Tracing Web Access Beyond Visible Answers》(arXiv:2607.14447v2,10款AI助手/200次试验/服务器日志+密语法受控实证),欢迎在评论区讨论。*