可抓取性是 GEO 和 SEO 共享的最底层地基:无论内容写得多好,如果 robots.txt 拦截了爬虫、页面依赖 JavaScript 渲染导致爬虫拿到空白 HTML、或者服务器频繁返回错误状态码,爬虫根本读不到真正的内容,后面所有优化都无从谈起。

常见的可抓取性问题

包括 robots.txt 误拦截了正常爬虫、页面内容完全依赖客户端 JavaScript 渲染(服务端返回的 HTML 是空壳)、重要页面深藏在多级导航之后没有清晰的内链路径、以及大量页面返回 404 却没有被发现和修复。这些问题往往是技术团队的历史遗留,内容团队很难自己发现。

排查顺序

诊断可抓取性问题,通常从最基础的检查开始:robots.txt 有没有意外拦截、网站地图 sitemap.xml 是否完整且能被访问、核心页面用爬虫视角查看源代码是否包含实际内容而不是空白框架。这几项确认无误后,才轮到讨论内容本身写得好不好的问题。