入口页面正常只说明该URL本身可访问、可抓取,不能证明深层路径上的每一跳都健康。当入口正常而深层失效时,断点通常落在三种位置:站内链接与跳转链、robots与规范化等抓取指令、以及服务端对深层路径的响应。定位方法是按“从入口到深层”逐跳取证,而不是从整站状态反推。
同一个现象——入口可访问、深层不可访问或不可索引——至少有两种成立条件完全不同的解释。
区分两者的关键证据是“直接请求深层URL的结果”。如果直接请求正常、沿入口点击却失败,断点在链路;如果直接请求也失败,断点在深层自身的可访问性或指令层。
实际动作是先固定一条代表性深层路径,然后逐跳记录状态,而不是一次抓取全站。
某一步返回301或302且最终URL偏离预期,说明断点在该跳的跳转规则;某一步返回200但内容为空或为模板占位,说明断点在内容生成而非链接本身。这个结果直接决定下一步:跳转问题查重写规则,内容问题查渲染与数据依赖。
深层路径常因指令设置而被排除,而入口页面不受影响。需要分别核查:
如果robots与noindex同时存在,先处理noindex再评估robots,因为两者叠加时无法判断哪一个在起作用。分开验证后,才能确定哪条指令是真实断点。
站点地图不保证收录,抓取量下降也不单独证明深层链路有问题。它们更合理的解释包括:抓取预算被其他路径占用、站点整体响应变慢、或外部链接结构变化。把这些信号当作线索而非结论,回到逐跳取证才能定位真实断点。
假设某站点入口页每天被正常抓取,深层页抓取量归零。可能原因是深层被noindex、被robots挡住、或入口到深层的链接被改为JavaScript生成而未被解析。这三种原因对应的修复动作不同,仅凭抓取量无法区分。
假设入口页正常,深层URL形如/list?cat=3&page=2。直接请求返回200,但从入口点击“下一页”后落到/list?page=2&cat=3,参数顺序不同,服务端将其视为新路径并返回空列表。
此时断点在参数规范化,而非深层不可访问。修复动作是统一参数顺序或让服务端对参数顺序不敏感。修复后重新请求两种顺序,若均返回相同内容,说明断点已消除;若仍失败,则需继续检查该路径是否命中其他重写规则。这一步的结果决定是继续查服务端,还是转向链接生成逻辑。
定位这类问题的通用原则是:先固定一条可复现路径,逐跳记录状态与最终URL,再用指令层检查排除robots、noindex和规范化干扰,最后才参考站点地图与抓取统计。每一步的结果都应缩小下一步的检查范围,而不是扩大猜测。