报告页数多于你手上真实的关键词对象数量,通常不是工具算错,而是“行数”和“对象数”被混为一谈。先判断差异来自分层展开、匹配变体,还是同一对象被多次列出,再决定是清洗明细、改用聚合视图,还是保留重复行只做标注。下面按两种条件给出不同做法。
拿到一份导出报告,第一件事不是删行,而是确认重复的性质。假设你导入 40 个种子词,报告却有 260 行,这可能是两种完全不同的情况。
判断方法很直接:随机抽 10 行,看它们是否共享同一个上级对象。如果共享,是膨胀;如果两行指向同一搜索意图却写法不同,是重复。这个判断决定了后面用哪种去重动作,做错方向会误删有效变体。
当差异来自分层展开时,去重的对象应该是“父级”,而不是明细行。此时按词面删除会直接砍掉有用的长尾。
可行的动作是建立两级结构:父级保留原始对象,子级保留展开行,并给每行加一列标记它归属哪个父级。之后统计数量时,按父级计数,而不是按行计数。这样报告页数仍然多,但“对象数”恢复成你导入的数量,两个数字不再互相打架。
例外情况:如果某个父级下出现了明显不属于该主题的变体,例如跨行业或跨语言的词,这类行应单独挑出,而不是并入父级计数。它们既不算重复,也不该留在原对象里。
当报告没有层级、所有词平铺在一起时,重复多半来自写法差异。这时去重的依据不是“看起来像”,而是一个归一化键。
常见做法是把每个词统一转成小写、去掉首尾空格、合并连续空格,再决定是否统一单复数。用 lower(trim(word)) 这类规则生成一个辅助列,然后按这一列找重复。保留哪一行,取决于你的用途:要投广告就保留搜索意图最明确的那条,要做内容规划就保留语义最完整的那条。
实施后你会得到两个数字:归一化前的行数和归一化后的唯一键数量。如果归一化后仍多于你的原始对象数,说明还有未覆盖的写法差异,需要补充规则,而不是继续手工删。
行数下降不等于处理正确。一个常见的误判是:把归一化后数量接近原始对象数,当成去重成功的证据。实际上数量吻合也可能是因为你误删了本该保留的变体。
建议抽三类样本回查:被合并的行、被保留的行、被单独挑出的异常行。如果合并的两行在搜索意图上确实等价,合并成立;如果它们只是字面相近但意图不同,就应拆回。这个回查动作会直接影响下一步:确认无误后才能把清洗结果交给执行人员,否则错误会沿着任务清单继续传递。
与其每次拿到报告重新纠结,不如把这次的判断写成可复用的规则:哪些字段参与归一化、单复数是否合并、分层展开是否按父级计数、异常行如何标记。规则一旦固定,报告页数与对象数量的差异就变成可解释的正常现象,而不是每次都要重新排查的异常。
需要提醒的是,不同工具对变体、匹配方式和语言的处理并不一致,具体字段和导出结构需要以你实际使用的版本为准。规则本身可以通用,但字段名和可用选项要自己核对一遍,再决定是否沿用。