当页面数从几十涨到几百上千,最先出问题的通常不是策略,而是执行方式。手工逐页改标题、逐条查死链、逐个提交地址,在早期是必要的学习过程,在规模扩大后却会变成瓶颈:改动速度赶不上内容增长,检查结果不可复现,出错后无法回滚。判断一项工作该保留手工、改写流程还是彻底退出,依据不是“是否高级”,而是三个条件:这项工作是否需要逐页判断,执行频率是否随页面数线性增长,以及出错后的影响范围有多大。
有些工作即使规模扩大,也不适合完全交给批量规则。典型是标题与描述的核心页面撰写、栏目结构设计、内链权重分配方向。这类工作的共同点是每个决定都依赖对业务和用户意图的理解,批量模板只会产出同质化内容。
但“保留手工”不等于“全部手工”。可以保留判断,把执行拆出去。例如:
适用条件是核心页面数量在可人工维护的范围内,比如几十个以内。一旦超过这个量级,连“哪些是核心页”的判断本身都需要用规则先筛一遍,否则手工清单会迅速过期。
规模扩大后最值得从手工转为半自动的,是那些规则清晰、但需要反复执行的任务。常见的有死链检测、重复标题扫描、站点地图更新、批量跳转设置、页面状态码巡检。
这里的“改写”不是一步到位全自动,而是先建立可复核的中间产物。一个可执行的最小动作是:先用爬取工具导出全站状态码清单,人工只处理非 200 的异常项,其余交给脚本定期重跑。动作的结果会直接影响下一步——如果异常清单里大部分是外部链接失效,说明问题在站外引用,处理优先级应低于站内 404;如果站内 404 集中出现在同一目录,说明是模板或路由问题,应先修模板而不是逐条补跳转。
需要说明的是,抓取量下降或某项统计归零,并不能单独证明处理正确。它也可能是爬虫调度变化、日志采样缺失或权限范围变化造成的。缺少完整日志或后台权限时,可执行的最小动作是只核对可访问页面的状态码和标题重复情况,结论仅限于“这批页面当前是否正常”,不能推出全站健康度。
有些手工工作应该直接停掉,而不是想办法优化。判断标准是:同一批页面交给两个人手工检查,结果是否一致;以及这项工作每月消耗的时间,是否已经挤占了内容生产的资源。
典型该退出的包括:手工记录每个页面的收录状态并逐日更新、手工统计排名位置并做成日报、手工为每个新页面单独提交地址。这些工作的共同问题是结果依赖查询时点、地区和账号,无法作为稳定依据,而规模扩大后逐页操作的时间成本会线性上升。
退出不等于放弃监控,而是换一种粒度:从“每页每天”改为“按目录抽样、按周对比”。假设一个站点有 2000 个页面,手工逐页检查需要数小时且容易遗漏;改为按栏目抽样 5%,十分钟内可以完成,代价是发现问题的延迟变长。这个取舍是否成立,取决于业务对时效的容忍度——促销页需要当天发现异常,常青内容页可以容忍一周的延迟。
面对一项具体工作,可以用以下顺序判断:
这个顺序的意义在于,它把“要不要自动化”的问题拆成了可回答的小问题。缺少完整数据时,仍然可以先完成第一步判断:列出当前最耗时的三项手工工作,标注它们分别依赖判断、频率还是风险。这份清单本身就是下一步动作的依据——如果三项都指向频率,优先改写流程;如果都指向判断,说明问题不在工具,而在页面分类规则还没建立。
很多人把手工执行的问题理解为“累”,实际更关键的是反馈周期被拉长。改动一批页面后,如果靠手工抽查确认效果,从改动到发现问题可能间隔数周;期间新增的页面又在沿用旧规则,问题被不断复制。
因此,规模扩大后应优先保留的不是某项具体操作,而是可复现的检查路径:同一套规则、同一批抽样页面、同一时间粒度。只要路径稳定,即使暂时缺少完整数据,也能区分“这次改动没效果”和“这次检查没覆盖到”。这也是把 SEO 理解为改善内容与搜索引擎理解过程的具体含义——抓取、索引、排名是不同环节,手工与自动化的取舍,本质上是在决定哪个环节需要人的判断,哪个环节需要机器的重复。