A5网站诊断怎样判断采集是否遗漏:先对齐页面清单再比对索引与内容

📍 WDQWDWQD987AAAAA:216.73.217.165
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /d4bb8aeee6f9.html
📄

A5网站诊断怎样判断采集是否遗漏:先对齐页面清单再比对索引与内容

判断采集是否遗漏,核心不是看“收录了多少条”,而是先确定应该被采集的页面范围,再用同一份清单去核对索引结果、站内日志或抓取记录,找出缺失、被替换和被过滤的页面。多人协作时,这份清单和核对口径必须提前约定,否则不同人拿不同标准判断,返工几乎不可避免。

准备:先定义“应采集清单”,不要边查边猜

遗漏是相对目标集合而言的。没有基准清单,就无法判断某条页面是“本来不该采”还是“该采却没采”。准备阶段要产出一份可交付的对照表,至少包含以下列:

关键动作是把“预期状态”写死。例如某列表页只保留最近 30 条,那么更早的分页属于应被排除,而不是遗漏。若这一步含糊,后面所有比对都会变成争论。

实施:用三种证据交叉核对,而不是只看一个数字

第三方估算流量、搜索引擎自己报告的数量、站内统计三者口径不同,不能互相替代。判断遗漏时,建议同时收集三类证据:

  1. 索引侧证据:用站内检索指令或站长工具查询页面是否在索引中。注意这只反映该引擎当前返回的结果,不等于抓取过。
  2. 抓取侧证据:查看服务器访问日志中对应爬虫的请求记录,区分“来过但没索引”和“根本没来过”。
  3. 内容侧证据:直接打开页面,确认标题、正文、分页、参数是否与清单预期一致。

把三者按 URL 逐行对齐后,遗漏通常分成几类:从未被抓取、被抓取但未索引、被索引但内容被替换、以及因参数或分页被合并。不同类别对应不同处理方向,混在一起会误判。

验证:最容易被忽略的一步是抽样回查

全量比对之后,必须做抽样回查,否则清单本身错了也发现不了。抽样时优先选三类页面:清单中标记为“应采集”的边界页、状态最近被修改过的页、以及多人分别登记过的页。

回查的判断标准是:同一 URL 在清单、索引结果、日志三处是否指向同一内容。如果清单写的是 A 页,索引返回的是 B 页,即使数量对得上,也属于遗漏或错配。假设某站点把列表页第 2 页与第 1 页合并展示,那么第 2 页在索引中消失属于预期合并,不应计为遗漏——这就是适用条件,判断结果取决于事先约定的预期状态。

维护:把口径变更记录下来,减少协作返工

采集范围会随栏目调整、分页规则变化而变动。维护阶段要做的不是反复重查,而是让每次口径变更都有记录:谁改的、改了哪条、影响哪些 URL。下次诊断时,直接以最新清单为基准,历史差异可追溯,不必重新争论。

多人协作的交付物建议固定为一份对照表加一份差异说明,差异说明只写“缺失类型、证据来源、待确认项”,不写推测性结论。这样接手的人能独立复核,而不是依赖某个人的口头判断。

下一步:拿你当前项目里已有的页面清单,先随机抽 20 条,按上面的三类证据做一次小范围比对。如果连这 20 条都无法对齐,说明清单口径本身需要先统一,再谈全量诊断。

图1 图2

nginx