先给结论:不要按“已发现/未发现”直接分组,而要先按页面模板、发布时间、内链层级和内容状态做分层,再在每一层内部随机选已发现页和未发现页。这样对照组才有可比性,否则你比较的可能是“新旧模板”或“深浅目录”的差异,而不是发现机制本身的差异。
如果两批页面来自同一套模板、同一批列表页入口,只是发布时间或内容新旧不同,那么可以直接做层内配对。做法是:先列出所有相关URL,按目录深度和模板类型分成若干层;在每层里,把已发现页作为对照,随机抽等量的未发现页。然后只改一个变量,比如给未发现页补一条来自已发现页的内链,或者把它们加入站点地图,观察后续抓取是否变化。动作结果是:如果补链后未发现页开始被抓取,而同一层未动的页面仍然没有变化,说明内链入口是主要限制;下一步应继续检查这些页面的入链数量是否长期偏低。
当未发现页大量来自旧内容、旧系统或已经退出的合作关系时,对照组不能只按“发现状态”划分。此时应先把页面分成“保留仍有价值的部分”和“准备退出”的两类。对保留部分,按当前模板和可维护入口重新分组,再抽已发现页作对照;对准备退出的部分,不要拿它们去证明发现机制是否正常,因为它们本身可能缺少维护入口。一个实际动作是:先给保留部分建立独立站点地图分组,并只在这组内部比较抓取变化;如果这组页面仍然只有一部分被发现,再回头检查模板和入口,而不是继续扩大退出页面的清理范围。
完成分组后,每次只改变一个因素,并保留一份未改动的同层页面作为参照。这样即使后续抓取量变化,你也能判断是哪个动作带来的,而不是把所有变化都归因于站点地图或提交动作。
robots.txt 里的抓取限制不等于可靠的索引移除,它只约束抓取,不保证页面从索引中消失。站点地图也不保证收录,提交后没有出现更多发现页,不能单独证明页面无价值。HTTPS 同样不保证安全无漏洞或排名提升,它不应成为对照组划分的主要变量。若你观察到抓取量或发现量归零,先别下结论,还要考虑服务器返回状态、入口被移除、模板改版、内容被合并等合理解释。不同搜索引擎对站点地图和抓取指令的支持情况须分别核查,不能拿一个引擎的表现直接套到另一个引擎。
假设一个vip域名下有200个旧活动页,其中80个已被发现、120个未被发现。先按模板分成A、B两层,A层是当前模板,B层是旧模板。只在A层内随机选20个未发现页补内链,另选20个未发现页不动。两周后复查:如果补链组出现抓取,未动组仍无变化,下一步应优先给A层其他未发现页补入口;如果两组都没有变化,下一步应检查A层页面是否被robots.txt限制、是否返回异常状态,或是否已从站点地图中移除。这个例子只说明比较方法,不代表固定见效时间。
最后要记住:对照组的价值在于让差异可解释。只要分组时把模板、入口、内容状态和退出计划分开,你就能判断该保留什么、该退出什么,而不是被“只有一部分被发现”这个现象牵着走。