先别把中断当成“失败”,也不要直接重跑。判断已覆盖范围的关键,是找到扫描器在中断前留下的可核对痕迹:任务日志、导出文件、结果页里的时间戳或计数。用这些痕迹确定一个“已确认边界”,再决定是补扫剩余部分还是重新开始。下面以你手里的一个站点或一组页面为对象,给出可执行步骤。
扫描中断后,最容易犯的错是把“结果里出现过的”都当作已完成。实际上,一次页面权重查询的结果通常包含三种状态,必须分开记录。
把这三类先分出来,后面补扫时才知道哪些必须重做、哪些可以跳过。判断依据不是你的直觉,而是日志时间戳和字段完整度这两类可核对证据。
大多数扫描工具会在任务日志里记录开始时间、每批处理时间或最后一条成功记录。找到中断前最后一条带时间戳的成功记录,把它对应的页面作为边界。
这样做的结果是:你得到一个明确的“补扫起点”。如果边界之后的页面数量远小于全站总量,补扫成本低,优先补扫;如果边界只覆盖了很小一部分、且日志时间戳跳跃很大,重新全量扫描往往比拼接两次不完整的结果更可靠。
中断扫描常伴随一个反常现象:某些页面的权重值比预期低很多,或者一批页面干脆没有值。不要直接下结论说“这些页面权重差”。先用证据区分原因。
假设一个场景:你扫描 500 个页面,日志显示处理到第 180 个时中断,但导出文件里有 260 行。多出来的 80 行很可能是字段不完整的疑似记录,而不是真的多扫了 80 个页面。此时正确动作是回到日志核对,而不是拿 260 这个数字去估算覆盖率。
判断完覆盖范围后,选择只有两个,但成立条件不同。
优先补扫的条件:日志边界清晰、已确认部分的字段完整、且未覆盖页面能被准确列出(例如你有站点地图或内链清单作为对照)。此时补扫剩余页面,再把两次结果按页面标识合并。合并后要抽查几条边界附近的记录,确认没有重复或遗漏。
优先重扫的条件:日志没有时间戳、导出文件字段大量缺失、或你无法确定中断发生在哪一步。这种情况下补扫的起点是猜的,合并结果会混入不可靠数据。重扫虽然耗时,但能保证整批结果来自同一次一致的处理过程。
无论选哪种,下一步动作都一样:把这次扫描的覆盖范围写进记录,包括扫描时间、条件、已确认页面数和未覆盖页面数。这样下次查询时,你能直接对照,而不是重新猜。
一次中断处理完后,留一份可核对的清单,比记住结论更有用。清单至少包含:任务开始与中断时间、已确认边界对应的页面标识、疑似列表、未覆盖列表、以及本次使用的查询条件。
之后再做页面权重查询时,先用这份清单核对新结果是否覆盖了上次未覆盖的部分。如果新结果里仍然缺少某些页面,先查这些页面是否可达、是否被查询条件排除,再考虑工具本身的问题。覆盖范围判断对了,权重值才有比较的基础;覆盖范围没确认,任何数值差异都可能是处理不完整造成的假象。