不适合继续手工做的,主要是那些“每次都要重复判断、结果必须前后一致、出错后影响面很大”的工作。典型有三类:全站可索引性检查、模板化元数据与内链的批量维护、以及跨版本的效果对照记录。判断标准不是工作量大小,而是手工方式是否已经无法稳定复现同一结果。一旦同一件事在不同人手里得出不同结论,就应该考虑改为规则化或脚本化处理;反过来,一次性诊断、策略取舍和内容判断,仍然适合保留人工。
规模小的时候,人工逐页检查是可靠的,因为页面少、变动少、检查者只有一两个人。规模扩大后,同一个检查动作会分化出不同结果:有人按URL抽样,有人按目录抽样,有人只看已收录页面。此时问题不在执行者是否认真,而在于手工流程没有固定输入和固定输出。
可以用一个简单证据来区分:让两个人独立检查同一批页面,记录各自发现的异常数量和类型。如果差异主要来自抽样范围不同,说明需要先统一检查口径;如果差异来自判断标准不同,说明这项工作需要写成明确规则,再决定是否交给脚本。这个动作的结果会直接影响下一步——口径不统一时,先别急着上工具,否则只是把混乱自动化。
不是所有重复出现的工作都该退出人工。以下三类通常应保留人工主导:
保留人工的前提是,这些工作确实需要结合上下文。如果一项工作已经能用固定条件描述清楚,例如“所有分页页面的标题是否包含页码”,那它就不再属于判断类工作,继续手工做只会增加不一致。
模板化元数据是最容易从手工转为规则的一类。标题、描述、面包屑、分页链接这些元素由模板生成,页面数量一多,逐页修改既慢又容易漏。适合改写的前提是:字段来源明确、生成逻辑稳定、异常情况可以枚举。
实际操作可以分两步。第一步,先人工梳理出所有模板类型,记录每类模板的字段来源和例外情况。第二步,把梳理结果写成生成规则,并保留一份例外清单。这样做的结果是,后续新增页面会自动套用规则,人工只需要处理例外清单,而不是每次从头检查全站。内链也是类似逻辑:固定位置的导航和推荐位可以规则化,正文中的语境化链接仍适合人工判断。
全站可索引性巡检和跨版本效果对照,是最应该退出纯手工的两项。前者需要覆盖大量URL,手工抽样无法保证覆盖度;后者需要固定时间窗口和固定指标口径,手工记录容易受记忆和记录习惯影响。
以假设情况为例:某站点有数千个页面,人工每周抽查一百个,连续几周后发现的异常类型开始重复,但无法确认未抽查部分是否也有同样问题。这种情况下,继续增加抽查量并不能解决覆盖问题,合理的动作是把巡检改为按规则批量执行,人工只复核批量结果中的异常项。这个动作的结果是,覆盖范围从抽样变成全量,人工投入从执行转向复核,下一步的决策依据也从“感觉有改善”变成可核对的异常清单。
需要说明的是,抓取量、索引量或某项统计归零,不能单独证明处理正确。它也可能来自统计口径变化、抓取预算重新分配或站点结构调整。区分这些解释,需要结合服务器日志、页面变更记录和索引状态一起看,而不是只看单一数字。
可以按以下顺序做决定:
这个顺序的价值在于,它把“要不要继续手工做”变成可讨论的条件,而不是凭感觉决定。规模扩大本身不会自动让手工方式失效,真正让它失效的是可复现性和覆盖度同时下降。先找出已经无法稳定复现的工作,再决定保留、改写还是退出,比一次性把所有流程都自动化更稳妥。