上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引时看到的是你希望用户看到的版本。建议在正式解析域名前完成一轮检查,上线后再复查一次,因为域名、协议和重定向会改变抓取结果。
要查的是 robots.txt、服务器响应和站内链接是否让爬虫能顺利到达页面。
你的域名/robots.txt,确认没有误写 Disallow: /,也没有屏蔽 CSS、JS 或图片目录。结果说明:如果整站被禁止抓取,后续索引配置全部无效。curl -I 页面地址 或浏览器开发者工具的 Network 面板,看返回码。200 表示正常,301/302 表示跳转,404 表示地址错误,5xx 表示服务器异常。结果说明:非 200 的地址即使被链接,也可能无法进入索引。要查的是页面级 meta 标签、HTTP 响应头和规范化设置。
<meta name="robots">。如果出现 noindex,该页面不会进入索引。结果说明:这是上线前最常见的误配置,测试环境残留会直接导致页面不被收录。curl -I 查看响应头中是否有 X-Robots-Tag: noindex。结果说明:响应头优先级高于页面标签,服务器或 CDN 层设置也会生效。<link rel="canonical"> 指向的是首选地址,且该地址返回 200。结果说明:canonical 指向错误地址,会让搜索引擎把权重和索引归到另一个 URL。要查的是协议、www 与非 www、结尾斜杠是否统一,以及重定向是否指向最终地址。
假设站点首选 https://www.example.com/,那么 http://example.com、https://example.com 都应 301 跳到首选地址,且只跳一次。结果说明:多个版本同时返回 200,会造成重复内容,索引分散;跳转链过长会削弱抓取效率。
检查方法:对每个变体执行 curl -I,记录返回码和 Location 头。判断标准是最终地址唯一、状态码为 301、跳转次数不超过一次。
要查的是 sitemap 中列出的 URL 是否都可访问、是否允许索引、是否与 canonical 一致。
结果说明:sitemap 是发现入口,不是收录保证。列出无效地址会浪费抓取预算,也会降低对 sitemap 的信任。
域名解析生效后,用搜索引擎官方的 URL 检查工具或抓取测试功能,分别对首页、栏目页和一篇内容页发起实时抓取。要查的是抓取到的 HTML 是否包含正文、canonical 和 meta robots 是否符合预期。结果说明:如果抓取结果与源码不一致,通常是 CDN、缓存或服务端渲染层的问题,需要回到对应环节排查。
下一步:把上述检查项整理成一张上线前核对表,每项标注负责人和复查时间,上线后 48 小时内再执行一次抓取测试,确认配置未被缓存或部署流程覆盖。