判断采集是否遗漏,核心不是看“收录了多少条”,而是先确定应该被采集的页面范围,再用同一份清单去核对索引结果、站内日志或抓取记录,找出缺失、被替换和被过滤的页面。多人协作时,这份清单和核对口径必须提前约定,否则不同人拿不同标准判断,返工几乎不可避免。
遗漏是相对目标集合而言的。没有基准清单,就无法判断某条页面是“本来不该采”还是“该采却没采”。准备阶段要产出一份可交付的对照表,至少包含以下列:
关键动作是把“预期状态”写死。例如某列表页只保留最近 30 条,那么更早的分页属于应被排除,而不是遗漏。若这一步含糊,后面所有比对都会变成争论。
第三方估算流量、搜索引擎自己报告的数量、站内统计三者口径不同,不能互相替代。判断遗漏时,建议同时收集三类证据:
把三者按 URL 逐行对齐后,遗漏通常分成几类:从未被抓取、被抓取但未索引、被索引但内容被替换、以及因参数或分页被合并。不同类别对应不同处理方向,混在一起会误判。
全量比对之后,必须做抽样回查,否则清单本身错了也发现不了。抽样时优先选三类页面:清单中标记为“应采集”的边界页、状态最近被修改过的页、以及多人分别登记过的页。
回查的判断标准是:同一 URL 在清单、索引结果、日志三处是否指向同一内容。如果清单写的是 A 页,索引返回的是 B 页,即使数量对得上,也属于遗漏或错配。假设某站点把列表页第 2 页与第 1 页合并展示,那么第 2 页在索引中消失属于预期合并,不应计为遗漏——这就是适用条件,判断结果取决于事先约定的预期状态。
采集范围会随栏目调整、分页规则变化而变动。维护阶段要做的不是反复重查,而是让每次口径变更都有记录:谁改的、改了哪条、影响哪些 URL。下次诊断时,直接以最新清单为基准,历史差异可追溯,不必重新争论。
多人协作的交付物建议固定为一份对照表加一份差异说明,差异说明只写“缺失类型、证据来源、待确认项”,不写推测性结论。这样接手的人能独立复核,而不是依赖某个人的口头判断。
下一步:拿你当前项目里已有的页面清单,先随机抽 20 条,按上面的三类证据做一次小范围比对。如果连这 20 条都无法对齐,说明清单口径本身需要先统一,再谈全量诊断。