收录量指搜索引擎已经编入索引的网站 URL 数量,不是搜索引擎"发现过"的全部 URL 数量——一个 URL 被爬虫发现、甚至被抓取过,也不一定会被编入索引。Google Search Console 的「页面索引」报告是官方提供的诊断工具,能看到哪些页面已编入索引、哪些没有,以及未编入索引的部分原因,但它不是网站全部 URL 的逐条完整清单,报告里给出的示例 URL 数量也有限。
收录不等于排名靠前
被收录只是一个页面有资格出现在搜索结果里的前提条件,不代表它一定能被搜到、更不代表能排在靠前的位置。判断一个页面表现好不好,还是要看它在具体查询词下的排名和点击情况,收录量本身只是一个入场券层面的指标。
noindex 和 robots.txt 管的是两件事
不少人把"用 robots.txt 屏蔽"和"不会被收录"划等号,这是常见的误解。noindex 才是明确告诉搜索引擎"不要把这个页面编入索引"的手段;robots.txt 管的是"能不能抓取",一个页面即使被 robots.txt 禁止抓取,只要有其他页面链接到它,搜索引擎仍可能仅凭外部链接信息把这个 URL 收录进索引,只是通常没有内容摘要可展示。想确保某个页面不被收录,应该用 noindex,而不是想当然地依赖 robots.txt;使用 noindex 时还要注意必须同时允许爬虫抓取这个页面,如果页面被 robots.txt 挡住了抓取,搜索引擎根本读不到页面里的 noindex 标签,这条规则也就不会生效。
到哪里查真实数据
第三方工具常用 site: 搜索指令估算一个网站的收录量,这类数字只是粗略参考,波动大、口径不透明,和 Google 官方数据经常对不上。Search Console 的「页面索引」报告是更权威的官方诊断入口,能看到具体是哪些 URL 被排除、排除原因是什么,但它同样不是网站全部 URL 的逐条完整清单,报告里展示的示例 URL 数量有限,不能把它当成网站所有页面状态的穷举列表。