AI 爬虫是各家 AI 公司派出来抓取网页内容的自动化程序,比较常见的有 OpenAI 的 GPTBot 和 OAI-SearchBot、Anthropic 的 ClaudeBot、字节的 Bytespider 等。它们抓取的内容一部分用于训练模型,一部分用于实时检索、生成回答。
容易被误伤
不少网站托管平台(包括 Cloudflare 等 CDN 服务)出于安全或反爬考虑,默认会拦截一部分自动化程序的访问,这些拦截规则有时会误伤正常的 AI 爬虫,导致网站在爬虫层面就已经被排除在 AI 搜索之外,而站长自己完全不知情。定期检查安全设置里有没有误拦截 AI 爬虫,是容易被忽略但影响很大的一步。
中英文站点的差异
不同 AI 公司的爬虫活跃度在中英文站点上表现差别很大,某些爬虫可能在英文内容上抓取频繁,在中文内容上访问量很低,这和模型训练语料的构成、检索合作方(比如中文搜索走的是哪家的索引)都有关系,判断爬虫行为不能直接套用海外案例的经验。