最常见的误解,是把死链工具发现的“404”“抓取失败”直接当成必须删除的页面,或者把 robots.txt 禁止抓取当成从索引中移除链接的手段。前者可能删掉仍有流量和转化价值的页面,后者只是阻止抓取,不等于可靠的索引移除。正确处理方式取决于链接类型、页面价值和错误来源,而不是看到报错就一键清理。
死链工具报出的 404 分几种情况。第一种是外部链接指向的旧地址,页面已经不存在;第二种是站内链接写错,指向了一个从未存在的路径;第三种是页面被误删或服务器配置错误,原本正常的 URL 返回了 404。只有第二种和第三种属于需要修复的站内问题,第一种往往需要做的是重定向或保留一个说明页。
判断时先看这个 URL 有没有外部链接和访问量。如果它曾经是有效页面、有外链或用户收藏,直接让它保持 404 会浪费已有信号;更合适的做法是设置 301 到内容最接近的现有页面。如果没有对应内容,可以返回 410 明确告知已删除,而不是随便跳到首页。
robots.txt 的作用是限制爬虫抓取路径,它不控制已经收录的链接是否展示。一个 URL 被 robots.txt 禁止抓取后,搜索引擎仍可能因为外部链接而保留该地址的索引条目,只是无法抓取内容来更新摘要。想移除索引,需要根据页面状态使用合适的响应码,或者通过各搜索引擎提供的移除工具分别处理。
这里要区分“抓取限制”和“索引移除”两件事。检查方法是:在搜索结果的收录状态里确认该 URL 是否仍被展示;如果仍被展示,单靠 robots.txt 不会让它消失。不同搜索引擎对移除请求的支持和生效时间不同,需要分别核查,不能假设一个平台的操作会自动同步到另一个平台。
站点地图是给爬虫提供 URL 清单的辅助文件,不保证每个 URL 都会被收录,也不保证收录速度。把大量 404 或重定向 URL 留在站点地图里,反而会浪费抓取预算,让真正需要收录的页面得不到及时处理。
可执行的检查项:
死链工具看到的“抓取失败”可能是多种原因:DNS 解析问题、服务器超时、防火墙拦截、临时 5xx、路径大小写不一致,或者工具自身的请求频率被限制。这些是可能原因,不等于已经定位的原因。把工具输出直接当成结论,容易误删正常页面或改错配置。
一个可执行的排查顺序:
curl -I 或浏览器直接访问报错 URL,记录返回的状态码和响应头。只有在确认 URL 确实无效、且没有保留价值时,才考虑删除或返回 410。对于有外链、有访问或有替代内容的 URL,优先修复链接或设置 301。
如果项目已经有稳定流量和外部链接,处理死链时应优先保护已有信号,而不是追求“零 404”。如果项目刚上线、页面数量少,可以更直接地清理无效链接。判断标准是:这个 URL 是否还有用户或外部来源在访问;如果有,保留并重定向;如果没有,再考虑移除。不同搜索引擎、网页搜索和付费广告对链接状态的处理方式不同,不能混为一谈。
下一步:从死链工具导出最近一次报告,按状态码和外链数量分成“需修复”“需重定向”“可移除”三组,先处理有外链或有访问的那一组,再复核站点地图和 robots.txt 是否与处理结果一致。