先给结论:入口页正常、深层页不收录,通常不是“整站被处罚”,而是某一段链路在抓取、渲染或索引环节断掉了。此时最该做的不是全站重写,而是先定位断点,再决定保留、改写还是退出——三种选择对应不同的前提和代价,选错方向会浪费数周。
入口页能被收录,说明域名级抓取和基础可访问性大体成立;深层页不收录,断点更可能落在以下位置之一:
区分方法:用抓取工具或日志观察深层 URL 是否被请求过。如果从未被请求,问题在抓取和渲染;如果被请求但未进入索引,问题在内容信号或页面身份。这个判断直接决定后面选保留还是改写。
适用前提是深层页内容有独立价值,且你确认它从未被抓取,或抓取到的 HTML 缺少链接与正文。此时合理动作是修复链路,而不是动内容:
动作后的结果如何影响下一步:如果修复后深层 URL 开始出现在抓取日志中,说明断点在链路,继续观察索引状态;如果仍无请求,说明入口页的链接权重或站点整体抓取预算不足,需要重新评估是否值得为这批深层页投入。
适用前提是深层页已被抓取,但长期停留在“已发现未索引”,或索引后又被替换。常见原因有两个:一是内容与入口页或其他深层页高度重叠,二是页面身份信号冲突。
此时改写的重点不是堆词,而是让每个深层页有可区分的主题和唯一身份:
假设一个场景:某深层页与入口页正文重合度很高,仅标题不同。改写后若该页仍不被索引,而其他同类页正常,说明问题不在内容量,而在页面身份或站内链接结构,应回到抓取层复查。
适用前提是深层页数量大、内容单薄、与入口页或其他页高度同质,修复链路的投入产出不成比例。此时保留和改写都不划算,退出是合理选择。
退出不等于直接删除。可行的动作是把有价值的片段合并进入口页或上级页,对无独立价值的地址设置 301 指向保留页,或对确实无用的地址返回 410。注意:robots.txt 的抓取限制不等于可靠的索引移除,想从索引中移除应使用 noindex 或 410,而不是只靠 robots 屏蔽。
动作后的结果如何影响下一步:合并后观察入口页是否承接了原有查询意图;若入口页流量和索引状态没有变化,说明这批深层页本就没有独立需求,退出决策成立。
把三个选择的条件对照成可核对的信号,避免凭感觉切换方向:
需要提醒的是,请求量或抓取量归零不能单独证明处理正确,也可能是抓取预算重新分配、站点其他部分变化或外部因素导致。HTTPS 也不保证页面安全无漏洞或获得更好排名,它只是基础条件之一。不同搜索引擎对渲染、canonical 和索引移除的支持情况须分别核查,不能用一个引擎的表现推断另一个。
最终判断标准是:断点在哪一层,就在哪一层动手。链路问题修链路,内容问题改内容,价值不足就退出,三者不要混用。