先给有条件的结论:如果报告里的“页数”是按行或按查询对象计数,而实际对象是URL、页面或关键词,那么两者不一致通常不是工具出错,而是同一对象被不同参数、不同子域或不同查询变体重复展开。能否去重,取决于你手上是否有导出明细、对象唯一标识和一条可复现的归并规则;若只有汇总数字,没有明细,就不能把差额直接解释成重复,也不能据此判断工具是否漏数。
报告页数与实际对象数量不一致时,第一步不是删行,而是确认计数口径。常见情况有三类:一是按“查询—URL”组合计数,同一URL出现在多个关键词下会被算多次;二是按URL计数,但带参数、带尾斜杠、http与https混用,同一页面被拆成多行;三是按页面或目录汇总,但实际对象是关键词,数量自然不同。
可执行的区分动作:从工具导出明细,保留对象标识列和计数列,先做一次count distinct,再与汇总页数比较。若去重后数量接近实际对象,说明差额主要来自组合展开;若去重后仍对不上,说明还存在筛选条件、时间范围或权限范围差异。这个动作的结果会直接影响下一步:前者只需归并规则,后者要先补齐口径说明。
没有全量导出权限时,仍可做三件小事:第一,抽取报告前若干行,标记哪些列能唯一识别对象;第二,用现有字段做一次人工归并,例如把同一路径的不同参数行合并;第三,记录归并前后数量差,并注明假设。这个最小动作的价值不是得到最终准确数,而是判断差额是否集中在少数重复模式上。
但必须说明不能推出的结论:抽样归并后数量下降,不能证明全量去重后一定等于实际对象数量;某次导出数量归零,也不能单独证明对象不存在,它还可能来自筛选条件过窄、权限未覆盖或时间窗口错位。请求量、抓取量或报告行数归零,同样有多种合理解释,不能直接当成处理正确的证据。
假设某份SEO排名工具报告显示120行,实际对象是80个URL,人工按路径去重后得到95行。此时若直接宣布“重复已清理”,结论可能失效,因为剩下15行差异可能来自:同一URL在不同设备或地区下的独立记录、分页参数被当成不同页面、或实际对象本身包含重定向目标与源URL。只要唯一标识没有统一,去重规则就会把不同对象误合并,或把同一对象继续拆开。
反例的关键不是数字大小,而是唯一标识是否稳定。若报告里没有稳定标识,只能先建立映射表,再决定归并粒度。映射表至少要能回答:这一行代表的是查询、页面、还是查询与页面的组合。
在明确唯一标识后,按以下顺序处理:
如果归并后数量仍与实际对象不一致,下一步不是继续删行,而是回到数据来源核对筛选条件、时间范围和权限范围。只有口径、标识和范围三者一致,报告页数才能作为后续判断的可靠输入。