梧州网站建设上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能访问页面、页面愿意被抓取、抓取后能进入索引。时间和人手有限时,按“先堵死问题、再放行收录”的顺序检查,优先处理会直接导致整站不被抓取或不被索引的配置。
要查什么:站点根目录下的 robots.txt 是否禁止了所有抓取,或误封了 CSS、JS、图片目录。
怎么查:在浏览器访问你的域名加 /robots.txt,逐行看 User-agent 和 Disallow。常见错误是测试环境留下的 Disallow: / 被带到正式站。
结果说明什么:如果存在 Disallow: /,搜索引擎会放弃抓取整站,后面所有优化都无效,必须最先改。如果只屏蔽了后台或搜索参数页,属于正常控制。注意 robots.txt 只约束抓取,不等于禁止索引;被屏蔽的 URL 仍可能因外链被索引,所以不要用它来隐藏内容。
要查什么:页面 HTML 的 head 区域是否带有 <meta name="robots" content="noindex">,以及 HTTP 响应头是否返回 X-Robots-Tag: noindex。
怎么查:打开几个代表性页面,右键查看源代码,搜索 noindex。同时用浏览器开发者工具的 Network 面板看响应头。批量站点可以抽首页、栏目页、详情页各一个。
结果说明什么:只要页面带 noindex,即使能被抓取,也不会进入索引。上线前测试环境常统一加 noindex,正式上线必须移除。若只想让某个页面不索引,用 noindex 比 robots.txt 更准确。
要查什么:站内导航、分页、详情链接是否为可抓取的 <a href>,以及返回的状态码。
怎么查:用浏览器禁用 JavaScript 后看主要链接是否还存在;逐个点开关键路径,确认返回 200,而不是 301 链路过长、302 临时跳转、404 或 500。把重要页面列成一张表,记录 URL 与状态码。
结果说明什么:返回 200 且是普通链接,抓取最顺畅。大量 302 会让搜索引擎难以判断最终地址;404 表示页面不存在,不该出现在导航里;500 表示服务器错误,会降低抓取频率。若链接依赖 JS 点击才生成,抓取可能不完整,应改为服务端输出或补充站点地图。
要查什么:每个页面的 canonical 标签指向的地址,是否与站点地图、站内链接使用的地址完全一致。
怎么查:抽 5 到 10 个页面,对比 canonical 里的 URL、sitemap.xml 里的 URL、实际访问的 URL。重点看是否混用了带 www 和不带 www、http 和 https、带斜杠和不带斜杠。
结果说明什么:三者一致时,搜索引擎能确定唯一收录地址。若 canonical 指向另一个版本,当前页面可能不被索引;若站点地图里全是 301 跳转地址,会浪费抓取配额。上线前应统一到一个主域名和协议版本。
Disallow: /,有就立即改。这四步覆盖了“能不能抓、愿不愿被抓、抓到的地址对不对”。做完后,用搜索引擎的抓取测试工具提交首页和一个详情页,观察返回的抓取状态与索引状态。若抓取成功但未索引,优先检查内容是否与已有页面高度重复,而不是反复改 robots.txt。