死链检测方法,怎样取得可复查的状态证据

📍 WDQWDWQD987AAAAA:216.73.217.165
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /3927be0c1455.html
📄

死链检测方法,怎样取得可复查的状态证据

要取得可复查的状态证据,核心是把每一次检测变成“有时间、有请求、有响应、有判断”的记录:对每个URL保存检测时间、请求方式、HTTP状态码、最终跳转地址和页面特征,再用同一批URL在另一个时间或另一条网络路径复测。只截一张“打不开”的图不够,因为它无法说明是服务器返回404、DNS失败、超时,还是被robots.txt拦住。

先定义什么算死链,避免证据口径不一

死链至少分三类:返回404或410的硬死链;返回200但内容已变成无关页面的软死链;以及多次超时、连接失败等不确定状态。证据要能区分它们。建议在记录表中固定以下字段:URL、检测时间、检测工具或命令、HTTP状态码、最终URL、响应耗时、页面标题或关键内容片段、判定结论。

判断结果时注意:404通常表示资源不存在;410表示已明确移除;301或302表示发生跳转,要记录最终落点;超时或连接重置只说明本次请求失败,不能直接判定死链,需要换网络或稍后复测。

可执行清单:每项查什么、怎么查、说明什么

  1. 查状态码。用命令行工具对单个URL发起请求,例如curl -I -L https://example.com/page,观察状态码和重定向链。结果说明资源当前是否可访问,以及是否跳到新地址。
  2. 查最终落点。在命令输出中记录最后一个URL和页面标题。若最终页面与链接原意无关,应标为软死链,而不是只看200就放过。
  3. 查抓取限制。检查robots.txt是否禁止抓取该路径。被限制抓取不等于页面已从索引移除,也不能证明页面不存在;它只说明自动抓取受阻,需要换用允许抓取的检测方式或人工访问确认。
  4. 查站点地图与内链。把站点地图中的URL与实际返回状态对照,同时抽查站内链接。站点地图不保证收录,但能帮助发现已提交却返回错误的地址。
  5. 查HTTPS与证书。确认证书是否过期、域名是否匹配。HTTPS不保证页面安全无漏洞,也不保证排名,但证书错误会阻断访问,属于需要单独记录的技术状态。
  6. 复测并留档。同一URL至少在不同时间复测一次,保存命令输出或表格记录。复测结果一致,证据更可靠;结果不一致,应标为“不稳定”,继续观察。

时间和人手有限时,先处理哪一批

优先顺序可以按“影响面×确定性”排:先处理返回404或410且被站内多处链接指向的URL;再处理跳转到无关页面的软死链;最后处理偶发超时。这样做是因为前两类状态明确、修复后能直接减少用户和抓取工具遇到的错误,而超时需要更多复测成本。

如果只能做一轮检测,至少保留三项证据:请求命令或工具名称、原始状态码、最终URL。没有这三项,后续很难判断问题是否已修复。

证据怎样算可复查

可复查的证据应让另一个人用相同URL和相同请求方式得到可比较的结果。建议把记录放在表格或日志中,并注明检测环境,例如本机网络、服务器所在网络或第三方检测服务。不同搜索引擎、网页搜索、平台推荐与付费广告对链接的处理方式不同,核查时应分别说明来源,不要用一次检测结果推断所有入口的表现。

下一步:选10个最关键的URL,按上面的清单做一轮检测,把状态码、最终URL和复测时间填入同一张表,再决定先修哪几个。

图1 图2

nginx