上线前核对抓取与索引配置,核心是确认三件事:爬虫能拿到页面、页面愿意被收录、收录后看到的是正确版本。时间和人手有限时,先查 robots.txt 与 meta robots,再查 canonical 与 sitemap,最后用实际抓取结果复查,不要一开始就逐页改标题描述。
抓取是索引的前提。如果爬虫被挡住,后面所有优化都不会生效。最先处理的是站点级拦截,因为它影响整站。
https://你的域名/robots.txt,确认没有 Disallow: / 这类整站屏蔽规则。<meta name="robots">,上线版本不应出现 noindex 或 nofollow。判断方法很直接:用抓取工具以搜索引擎爬虫身份请求一个典型产品页,返回 200 且内容完整,才算通过。若返回 403、503 或跳转到登录页,先处理服务器与防护规则,不要继续查收录。
能抓取不等于会被索引。索引配置决定页面是否进入候选库,以及进入的是哪个地址。
这里最常见的误判是:页面能打开,就以为会被收录。实际上 canonical 指错、meta robots 写错、sitemap 提交了错误地址,都会让页面停在索引之外。优先处理产品详情页和核心分类页,这两类页面直接关联询盘与转化。
配置正确不代表抓取结果正确。上线前应做一次真实抓取复查,顺序如下:
复查时如果发现“已抓取但未索引”,先看页面内容是否与站内其他页面高度重复,再看 canonical 是否指向了别的地址。若发现“已发现但未抓取”,优先检查服务器响应速度和内链是否可达。不同搜索引擎的站长平台给出的状态名称不完全相同,按各自平台的实际提示判断即可。
人手不足时,不要平均用力。按影响面排序:
如果只有半小时,就完成第一步和第二步的抽查;如果有一整天,再补第三步和第四步。判断是否完成的标准不是“改过了”,而是抓取工具返回的最终 URL、canonical 和 meta robots 三者一致,且 sitemap 中不存在非 200 地址。
上线后不要立刻反复提交或频繁改动配置。先让搜索引擎完成一轮自然抓取,再回站长平台看抓取统计与索引覆盖。若核心产品页仍未进入索引,用 URL 检查工具请求抓取该页,根据返回的状态与 canonical 判断是抓取问题还是索引问题,再决定改服务器、改页面配置还是改内链。每次只改一类配置,改完复查同一批页面,避免多处同时调整后无法判断哪一项起了作用。