上次打开 Cloudflare 的 AI Crawl Control 面板看完中文站的数据后,我顺手把手上另一个英文站也点开看了看。本来只是习惯性检查一眼,结果两组数据一对比,发现完全是反过来的。

一、中文站:搜索引擎爬虫是主力,AI 原生爬虫靠后

过去 24 小时,这个站总共来了 54 次 AI 爬虫请求,全部放行,0 次失败。按公司拆开看:

  • Google(Googlebot):19 次
  • Microsoft(BingBot):16 次
  • ByteDance(Bytespider):13 次
  • Anthropic(ClaudeBot):4 次
  • OpenAI(GPTBot):2 次

中文站过去 24 小时的 AI 爬虫抓取数据,Google 和 Microsoft 占大头

Google 和 Microsoft 两家占了六成以上,真正意义上的"AI 原生爬虫"——ClaudeBot、GPTBot——反而是访问量最少的那一档。

二、英文站:AI 原生爬虫反而是主角

同样是过去 24 小时,另一个英文站的画像完全反过来了。总请求 46 次,比上一周期涨了 64.3%,同样是 0 次失败:

  • OpenAI(GPTBot):18 次
  • Anthropic(ClaudeBot):15 次
  • Google(Googlebot):11 次,比上一周期暴涨 266.67%
  • Microsoft(BingBot):2 次,降了 50%

英文站过去 24 小时的 AI 爬虫抓取数据,GPTBot 和 ClaudeBot 占大头

GPTBot 和 ClaudeBot 加起来占了七成以上,Google 排第三,Bing 几乎可以忽略——和中文站的顺序正好倒过来。

三、为什么会反过来

结合两组数据看,这个反差其实说得通。

中文互联网里,很多"AI 搜索"能力本质上是调用搜索引擎已经抓取、索引好的结果做二次组织,产品自己的爬虫不一定会频繁直接上门。所以中文站里,真正勤快的还是 Googlebot、BingBot 这两个老面孔,AI 产品在中文场景里,更像是站在搜索引擎肩膀上做事,而不是自己天天来爬你

英文/海外内容生态则不一样。GPTBot、ClaudeBot 这些 AI 原生爬虫会更主动地直接抓取网页做检索增强和训练,不完全依赖 Google、Bing 的索引数据——所以在英文站上,它们的抓取量直接反超了传统搜索引擎。

这和之前那篇《国内 GEO vs 海外 GEO,两套完全不同的打法》里的判断刚好对上:同一个问题分别问 ChatGPT 和豆包,引用来源几乎没有交集,国内和海外建立在两套完全不同的内容生态上。这次从爬虫抓取数据的角度,又多了一份具体的证据。

四、两个启示

做中文内容,先把 Google、Bing 收录做扎实。 这两个才是中文场景里真正频繁上门的爬虫,AI 产品的可见性,很大程度上还是建立在传统 SEO 的地基之上。

做英文/出海内容,GPTBot、ClaudeBot 本身就是重要访客。 它们直接抓取、直接影响 AI 的回答,不能只按传统 SEO 的思路去伺候搜索引擎,对 AI 爬虫友好(robots.txt 放行、llms.txt 说明)这件事,在英文站上的权重要更高。

同一个人手上的两个站,看到的却是两套完全不同的爬虫世界。定期打开 Cloudflare 这个面板看一眼,比凭感觉判断"AI 认不认识我"靠谱得多——尤其是当你中英文站点都在运营的时候,数据会告诉你两条完全不一样的路该怎么走。