判断采集是否遗漏,核心不是看总流量涨没涨,而是把“应该被采集到的对象”列成清单,再逐项核对采集结果。只要清单里的对象在采集结果中缺失、数量对不上、字段为空或更新停滞,就说明存在遗漏。第一次接触这个问题时,先确定你要核对的对象范围,再选一个可复现的检查口径,最后用抽样复查确认结论,而不是凭感觉判断。
采集遗漏必须有一个基准。没有基准,就无法判断是“本来就没有”还是“没采到”。常见的基准有三类:
先选定其中一类作为对照。若三类基准数量不一致,说明基准本身有问题,应先统一口径,再谈采集是否遗漏。
不要只看总量。总量接近也可能掩盖局部遗漏。可以按以下顺序观察:
这三项中,数量差是最直接的信号,字段和更新异常则用于定位遗漏发生在哪一层。
发现数量对不上时,先别急着下结论。可能原因有两类:一是采集确实漏了,二是两边口径不同。可以用下面的检查项逐条排除:
只有当这些口径差异被排除后,剩下的缺口才更可能是真遗漏。已经定位的原因要写清楚,例如“某栏目分页只采到第3页”,而不是笼统说“采集不全”。
确认遗漏后,先补齐采集范围,再复查。复查不能只看总数是否恢复,还要抽几个具体对象验证。例如,从基准清单中随机取10个此前缺失的对象,逐个在采集结果中查找。若全部能找到且字段完整,说明该批遗漏已处理;若仍有缺失,说明采集规则还没覆盖到对应入口。
复查时保留一份对照记录,写明基准来源、检查时间、缺失对象编号和处理结果。这样下次再遇到数量对不上,可以直接复用同一套口径,而不必重新猜测。
下一步,先确定你的基准清单来自哪里,然后按“数量—字段—更新”三项做一次完整比对,把缺口对象单独列出来。只有先固定基准,判断采集是否遗漏才有可复现的依据。