判断采集是否遗漏,核心方法是做一次“样本对账”:从站内自己掌握的全部可访问URL中分层抽样,再用网站安全检测工具能提供的抓取日志、链接发现或页面快照能力,逐条比对哪些URL从未被抓取、哪些被抓取但未入库。单看收录量、索引量或某个估算数字,都不足以判断遗漏,因为不同口径的统计范围本来就不一致。
“采集遗漏”至少有三种含义,判断前要先分清,否则结论会互相矛盾:
网站安全检测工具通常覆盖的是第二层,部分工具能通过日志分析覆盖第一层。如果你的工具只做漏洞扫描,那它判断不了采集遗漏,需要换用带日志分析或URL发现功能的工具,或直接用服务器访问日志。
时间和人手有限时,不要全站比对,按下面步骤抽100到300条URL即可得到可用结论:
noindex或robots限制。假设某栏目有200个详情页,抽样20个,其中6个在日志中从未出现,且这6个页面都没有任何站内链接指向,只能通过站点地图发现——这就是典型的发现遗漏,优先补内链,而不是改服务器配置。
可核查的证据链包括:服务器访问日志中的爬虫User-Agent与请求时间、站点地图提交记录、页面返回状态码、站内链接图谱。这些是你能直接验证的。
不可靠的信号:第三方估算的流量或收录数字、单一平台的索引量。它们与站内统计口径不同,覆盖范围也不同,只能作为参考,不能作为遗漏与否的判据。如果工具只给一个“收录率”百分比而不展示具体URL列表,就无法定位到底漏了哪些页面。
按影响面排序,优先处理满足以下条件的遗漏:
反之,如果遗漏集中在低价值筛选页或大量重复的参数URL上,可以不处理,甚至应该主动限制抓取,把抓取预算留给有效页面。
修复后不要只看一次结果。隔一段时间重新抽样同一批URL,检查三件事:抓取日志中是否出现请求记录、返回状态码是否为2xx、页面是否进入采集库。三项都满足才算修复生效。如果只有请求记录但状态码仍是5xx或被拦截,说明问题在服务器或安全策略,不在链接发现。
下一步:导出你站点最近一周的访问日志,筛出爬虫请求,与站点地图URL清单做一次差集,先看差集里有多少是有效内容页,再决定优先补链接还是优先查拦截。