先别急着重跑。判断已覆盖范围的关键不是看软件给出的“完成百分比”,而是看它中断前有没有留下可核对的抓取日志、URL清单和状态标记。如果这三样都不完整,唯一可靠的做法是重新扫描;如果日志和清单完整,可以按“已知覆盖+待补缺口”的方式分段续跑,代价是多花一次核对时间,但能避免全站重扫的资源浪费。
一次全站扫描中断后,你手里通常只有软件的界面状态和导出文件。判断覆盖范围前,先检查这三类证据:
如果日志里只有“成功”和“失败”两种状态,没有“待抓取”,那中断后你无法区分“还没轮到”和“已跳过”。这种情况下,覆盖范围不可信,应重新扫描。
假设你确认日志和清单完整,接下来有两种做法:
选择条件可以这样判断:如果已抓取URL数量占完整清单的比例超过七成,且日志时间戳连续,差集续跑更划算;如果比例低于三成,或者日志时间戳有断裂,全站重扫更稳妥。这里的比例只是帮你比较两种做法的相对代价,不是固定阈值。
假设你有一个包含1000条URL的清单,中断时日志显示已抓取620条,其中580条状态为“已抓取”,40条为“失败”。清单中剩余380条没有出现在日志里。
第一步,把580条“已抓取”标记为已覆盖。第二步,40条“失败”需要单独处理:它们可能因为超时、拒绝访问或状态码异常而失败,不能算作已覆盖,但也不等于需要重新发现。第三步,剩余380条属于未覆盖。
此时你可以导出一个只包含这380条加40条失败URL的新清单,交给软件续跑。动作结果是:续跑范围从1000条缩小到420条,节省了已覆盖部分的重复抓取。下一步,续跑完成后,把新日志与旧日志合并,再检查失败URL是否仍然失败。如果同一URL连续两次失败,才需要人工检查该页面是否真的不可访问。
有几种情况容易让人误判:
这些现象都需要结合日志时间戳和URL清单交叉验证。如果无法交叉验证,重新扫描是唯一能明确覆盖范围的做法。
不同百度seo软件对中断恢复的支持程度不一样。你需要核对自己所用工具是否支持导入自定义URL列表、是否保留历史抓取状态、是否能合并多次扫描结果。这些具体功能需要以你手中软件的当前版本为准,不能凭通用说明推断。如果软件不支持导入清单,差集续跑就无法执行,只能全站重扫。
确认方式很简单:在软件里找“导入URL”或“继续上次任务”之类的入口,实际试一次小批量导入,看它是否接受你整理好的差集清单。如果导入后软件重新发现全站URL,说明它不按你给的清单执行,差集续跑不成立。