结论是:只有在URL映射关系可验证、且两套统计口径能对齐到同一时间粒度时,才可以把改名前后数据拼成一条连续序列;否则应当保留两条独立曲线,用标注说明断点。页面改名最容易被忽略的后果不是流量立刻下跌,而是旧URL和新URL各自累积了半段记录,直接相加会同时放大和掩盖真实变化。
拼接不是把两张报表粘在一起,而是先证明“旧页面的访问”和“新页面的访问”在统计上属于同一对象。需要同时满足:
三个前提里任意一个不成立,拼接出来的曲线就只能当作参考,不能当作决策依据。比如统计工具在改名前后分别按“页面路径”和“页面标题”聚合,那么两段数据根本不在同一个维度上,拼起来只是数字相邻。
假设你只改了三个内容页的URL,做重定向后,旧URL的访问量逐步转移到新URL,两段相加基本等于历史水平,于是你判断“拼接方法可用”。这个结论在三个页面时成立,因为每个页面的旧新对应关系清晰、人工核对成本低。
但当改名范围扩大到几百个页面,并且其中一部分旧URL还存在参数变体、大小写变体或带尾斜杠的变体时,情况会变。此时可能出现:部分旧URL的统计记录被拆分到多个变体条目下,新URL又只承接了其中一部分跳转;两段相加后,总量看起来接近历史值,但单个页面的前后对比已经失真。更隐蔽的是,某些跳转链路中间多了一跳,统计工具在中间页面上记录了一次访问,于是新旧相加时把同一次访问算了两遍。
这个反例说明:拼接方法能否成立,取决于映射关系是否唯一,而不是取决于样本量大小。 小范围改名时人工可以兜住例外,规模化后例外会变成常态,此时正确做法是放弃直接相加,改为按“页面组”聚合,或者只比较改名后新URL自身的趋势。
判断能否拼接,不靠感觉,靠一组能互相印证的记录。建议按下面的顺序收集:
如果清单里出现“一个旧URL对应多个新URL”或“多个旧URL对应同一个新URL且无法区分来源”,拼接就必须降级为分组汇总。这一步动作的结果会直接决定下一步:能唯一映射就做连续序列并标注断点;不能唯一映射就保留两条曲线,把分析重点放在改名后的新URL表现上。
即使三个前提都满足,拼接后的序列也不应当被当成一条没有断裂的曲线。改名当天或当周通常会出现一次采集抖动,原因可能是重定向缓存、爬虫重新抓取、统计脚本重新识别页面,这些都不等于真实流量变化。因此需要在图表和记录中保留断点标注,写明改名时点、映射方式和口径说明。
这样做的好处是:当后续有人拿这条曲线做同比或环比时,能立刻看到断点存在,不会把采集抖动误读为内容效果。拼接的目的是让趋势可读,不是让断点消失。
先做一次小范围验证:挑三到五个已改名的页面,按上面的证据链逐条核对,确认旧新映射唯一、口径一致、时间对齐。如果验证通过,再把方法扩展到同批次的其余页面,并在扩展过程中持续抽查映射关系;如果验证中出现映射不唯一或口径不一致,就停止直接相加,改为分组汇总并单独记录改名后的新URL趋势。这个动作的结果决定了你是得到一条可用的连续序列,还是得到两条需要分别解读的曲线,后续所有对比都应基于这个判断展开。