比较第三方估算与站内数据,核心不是判断谁更准,而是先看两者统计口径是否一致,再决定以哪一方作为决策依据。第三方估算通常来自外部爬取、抽样或被动流量观察,站内数据来自服务器日志、统计脚本或扫描工具自己的任务记录。口径不同时,直接对比数字会得出错误结论。
第三方估算可能统计的是被公开索引的页面、外部可观测的响应特征或某段时间的访问样本;站内数据统计的是全部请求、已登录流量、内部接口调用或完整扫描结果。比较前要逐项核对:时间范围、对象范围、是否含子域名、是否含内部页面、是否过滤爬虫、是否去重。
如果这些口径无法对齐,比较结果只能作为方向参考,不能作为验收结论。
假设你要用两类数据回答“扫描覆盖是否完整”,交付结果应是一份可复核的对照表,而不是一个百分比。倒推需要的资料包括:站内扫描任务清单、每个任务的开始与结束时间、目标地址范围、扫描规则版本、第三方估算的采集时间与覆盖说明。责任上,站内数据由执行扫描的人提供原始导出,第三方数据由提出估算的一方说明来源和限制。验收时逐项标注“一致”“站内多出”“第三方多出”,并写明多出部分的原因。
第一步,选定同一时间窗口,例如某月1日至7日。第二步,从站内数据导出目标地址列表和扫描状态。第三步,从第三方估算导出其覆盖的地址或页面列表。第四步,用地址作为主键做匹配,不要用页面标题或数量总数直接相减。第五步,对不匹配项逐条判断。
判断结果分三种:
短示例:假设站内记录扫描了 120 个地址,第三方估算列出 100 个地址,匹配后 90 个重合。不要直接说覆盖率是 90/100 或 90/120,而要先看站内多出的 30 个是否属于公开范围、第三方多出的 10 个是否仍然存活。只有把范围统一后,比值才有意义。
这套比较方法适用于需要判断扫描范围是否遗漏、修复是否被外部感知、或向他人说明覆盖情况的场景。不适用于把第三方估算当作站内资产的完整清单,也不适用于用站内数据否定第三方对公开暴露面的观察。两者回答的问题不同:站内数据回答“我扫了什么”,第三方估算回答“外部能看到什么”。
先选一个时间窗口,把站内扫描导出和第三方估算导出并排放在同一张表里,用地址做匹配,逐条标注差异原因。完成一轮后,把无法对齐的口径写进下一次扫描的任务说明,再决定是否需要补扫或调整对外说明。