当页面数量、栏目层级和更新频率同时上升时,手工维护内链、逐页检查标题和人工提交网址这类工作会从“可控”变成“不可控”;但结论有前提:只有当同类页面达到一定数量、且模板结构已经稳定时,才应把重复劳动交给规则或脚本。反之,如果站点仍处在栏目频繁改版、模板反复调整的阶段,过早自动化会把错误批量放大,手工反而更安全。
手工操作是否该退出,不取决于工作量大小,而取决于三件事:重复度、出错后的影响范围、以及是否依赖单个人的记忆。重复度高、影响范围可预估、判断标准能写成明确规则的工作,优先考虑自动化;需要结合业务语境做取舍的工作,继续保留人工。
一个可操作的判断动作是:把最近一个月手工做过的同类操作列出来,标注每次耗时和出错次数。如果某一项操作重复出现且出错集中在固定几个环节,说明它已经具备被规则替代的条件;下一步应先写出规则说明,再用小批量页面验证,而不是直接全站执行。
规模扩大后最容易被误判的一点,是把“量大”直接等同于“该自动化”。如果栏目标题格式、URL 结构和页面模板还在频繁调整,那么脚本批量写入的内链、规范化标签和结构化数据,会随着下一次改版全部失效,清理成本可能高于当初手工维护。
反例很明确:一个站点刚决定把产品页从两层目录改为三层目录,此时若用脚本批量生成旧结构下的内链和站点地图,等目录调整完成后,这些链接会大面积指向失效地址。抓取异常、索引减少或某类页面收录变慢,都可能由此产生,但这些现象并不能单独证明是自动化导致的——服务器响应、内容质量变化、外部链接波动同样会造成类似结果。因此看到异常时,应先区分是结构问题、内容问题还是抓取问题,再决定是否回退自动化。
规模扩大后更稳妥的做法,不是简单地把手工换成脚本,而是把每项工作拆成三段,并明确每段由谁负责。
这套拆分的关键在于:规则一旦确定,就不要在一次执行中同时改动多个变量。假设某次调整只改变内链规则,那么复核时观察到的变化更容易归因;如果同时改了模板和链接结构,即使数据出现波动,也无法判断是哪一项造成的。数字在这里只用于说明比较方法,例如抽查 30 个页面中若有 5 个不符合预期,应先修正规则再扩大范围,而不是继续全量执行。
并非所有重复工作都适合自动化。以下几类即使页面数量增加,也建议保留人工判断:
这些工作共同点是:判断依据无法完全写成规则,且一旦判断错误,影响的是整站方向而非单个页面。把它们交给脚本,只会把错误执行得更快。
如果站点已经出现“手工做不完”的迹象,不必一次性重构全部流程。更实际的动作是选一项重复度最高、规则最容易写清的工作,例如批量检查同类页面的标题重复,先在一个栏目内执行,记录处理前后的差异和异常数量,再决定是否推广到其他栏目。这个动作的结果会直接影响下一步:如果小范围验证中异常集中在少数模板,说明问题在模板而非规则,应先修模板;如果异常分散且无规律,说明规则本身还不够明确,应继续补充判断条件,而不是急于扩大自动化范围。