先明确一个前提:在缺少完整站点数据或后台权限时,你无法凭报告本身证明哪一条是重复。可行的最小动作是,从报告里抽出一组可疑记录,用可独立核对的标识(URL、对象ID、标题+路径)做一次人工比对,再决定是改检查范围、改去重规则,还是把这批记录标记为待确认。这个动作能告诉你重复发生在哪一层,但不能直接推出全站数量,也不能证明工具漏检或误检。
报告里的数字通常来自不同层级,混在一起看就会觉得对不上。常见的有三种:抓取到的响应记录数、去重后的唯一对象数、以及通过某种规则归并后的逻辑页面数。同一批数据在这三种口径下可以差出很多。
拿到报告后,先看它有没有说明计数口径。如果没有,就自己找证据:
这三种情况的处理方式完全不同。第一种要定参数策略,第二种要定规范化主机名,第三种要判断是否真的算重复对象。在没分清之前,任何去重都是盲目的。
不要一上来就处理整份报告。先取20到50条可疑记录,为每条补齐两个字段:一个是用于归并的规范标识,一个是用于判断是否同源的内容指纹。
规范标识可以按这个顺序生成:去掉片段标识、统一协议与主机名大小写、决定是否保留查询参数、去掉末尾多余的斜杠。内容指纹可以用标题加正文字段的组合,或者页面主要内容的摘要。两者都只是假设方法,具体字段取决于你手上有什么数据。
然后做一次对照:
这个动作的结果会直接决定下一步:如果第1类占多数,说明问题在地址归一,改规则即可;如果第3类占多数,说明问题在内容归属,需要人工确认,工具层面解决不了。
没有后台权限,就拿不到对象ID、发布时间、发布者这类内部字段,也无法确认某个地址是否被重定向到另一个地址。此时仍然可以做的动作是:用公开可访问的响应状态和页面内容做比对,把可疑记录分成“可合并”“待确认”两堆。
需要说明的是,抽样比对只能说明这批记录的情况。报告页数减少,可能是去重生效,也可能是抓取范围被缩小、部分地址被拦截、或某类响应没有被记录。这几种解释在只看数字时无法区分。所以不要用“数量变少了”当作处理正确的证据。
同样,抽样里没有发现重复,也不能推出全站没有重复,只能说明当前抽样范围内没看到。要缩小这个不确定性,可以换不同入口、不同目录层级再抽一组,看结论是否稳定。
假设某份报告显示320条记录,实际你只维护着约180个内容对象。按上面的方法抽取30条,发现其中12条是同一路径带不同查询参数,5条是 http 与 https 各出现一次,剩下13条各自独立。
按这个分布,前两类共17条属于地址归一问题,可以先改归并规则再看总数;13条独立记录说明还有一部分差异来自别的原因,需要继续抽。这里的320和180都只是用于说明比较方法的假设数字,不代表任何真实站点。
处理顺序建议是:先改归并规则并重新生成一次结果,再拿新旧两份报告对比同一批记录的归并情况。如果归并后仍与预期对象数有差距,差距部分就是需要人工确认的,而不是继续调规则能解决的。
去重不是一次性动作。每次调整归并规则,都会改变哪些记录被合并。因此至少要留下三样东西:本次使用的归并规则、抽样比对的结果、以及被标记为待确认的记录清单。这样下次报告数字再变时,你能判断是规则变了、数据变了,还是抓取范围变了,而不是重新猜一遍。
如果工具本身提供去重或归并选项,具体名称和位置需要以你实际使用的版本为准;在确认之前,先用上面的人工比对方法验证它到底按什么口径合并,再决定是否依赖它。