先给结论:当同一批访客被分配到不同页面版本时,最需要防的不是版本之间差异太小,而是样本本身已经被污染,导致你比较的根本不是两个版本。识别样本污染的核心动作,是先确认分流是否真的随机、各版本样本是否来自同一批访客来源,再决定保留、改写还是退出这次对比。如果分流机制本身有问题,任何版本差异的结论都不能采信;如果分流正常但某一版本混入了异常流量,则应先清洗样本再比较;只有分流与样本都干净,版本差异才值得作为决策依据。
很多团队看到两个版本访问量接近,就默认分流正常。但数量接近不等于随机。样本污染最常见的形式,是某个版本被系统性地分配给了特定来源的访客。例如,假设你的分流规则按访问时间切分:上午访客进A版,下午访客进B版。这时如果上午的流量主要来自搜索,下午的流量主要来自老访客回访,两个版本的样本来源就不同。你比较的其实是“搜索访客”和“回访访客”,而不是两个页面版本。
识别方法是查分流日志与来源分布的交叉关系。具体动作:把每个版本的访客按来源渠道、设备类型、新老访客三个维度分别统计占比。如果某个版本在任一维度上的占比明显偏离整体,就说明分流可能不随机。这一步的结果直接决定下一步:若发现明显偏离,应暂停对比,先修正分流规则;若各维度占比接近,才进入样本清洗环节。
分流正常不代表样本干净。异常流量混入某一个版本,同样会污染对比结果。常见来源包括:某个版本被外部链接集中引用带来的非目标访客、被自动化程序集中访问、或某个版本在特定时段遭遇了异常请求。
判断样本是否被污染,可以看三个可核查的证据:
需要说明:以上任一现象都不足以单独证明样本被污染。会话时长骤降也可能来自页面加载变慢,来源集中也可能来自一次正常的合作推广。因此要把多个证据放在一起看,并回到分流日志确认这些访客是否被正确分配。
如果确认某一版本混入了非目标流量,处理动作是:将该部分访客从两个版本的对比样本中同时剔除,而不是只从被污染的那个版本剔除。只剔除一边会破坏分流的对称性,让剩余样本仍然不可比。完成清洗后,重新计算两个版本在核心指标上的差异,再判断差异是否稳定。
保留对比的适用前提是:分流规则经核查确实随机,各版本在来源、设备、新老访客维度上分布接近,且异常流量已被对称剔除。此时版本差异可以作为下一步决策的参考。但要注意,即使样本干净,一次对比的结果也只说明在这批访客和这个时间段内的表现,不能直接外推到全部流量。
改写对比设计的适用前提是:分流基本正常,但样本量在某个版本上明显不足,或某一版本的流量集中在少数来源。此时不应直接下结论,而应调整分流比例或延长观察窗口,让两个版本积累到可比的样本量后再判断。改写的是对比设计,不是页面本身。
退出对比的适用前提是:分流规则本身存在系统性偏差,例如按时间、地域或用户身份切分,且短期内无法修正。这种情况下继续对比只会产生误导性结论。退出不是放弃优化,而是先把分流机制改好,再重新开始。
这个顺序的关键在于:先验证分流机制,再清洗样本,最后才比较版本。跳过前两步直接看版本差异,等于在一个不可比的基础上做判断。实际执行时,如果第三步发现分流规则无法在短期内修正,就应直接进入退出流程,把精力放在修正分流机制上,而不是继续解读被污染的对比结果。