额度有限时,最有信息量的样本不是随机抽一批,而是能同时暴露“页面是否可索引”“词与页是否匹配”这两类问题的交集样本。若你手里有完整站点地图但缺少排名数据,优先抽“已有展示但位置靠后”的页面;若你只有一批目标词而缺少页面清单,优先抽“多个词指向同一页面”的词组。两种条件下的选择依据不同,下面分别说明。
这种情况下,额度应花在能区分原因的页面上。一个页面没有排名,可能是内容与词不匹配,也可能是页面根本没被正常索引。这两类问题的处理动作完全不同,所以样本要能帮你分开它们。
具体动作:从站点地图或后台导出的页面里,先筛出已有少量展示、但平均位置明显靠后的页面,抽 10 到 20 条。对每条只查两件事——该页面的目标词,以及该页面是否出现在索引中。
假设某分类页有 200 个页面,你抽了 15 条,其中 9 条不在索引、6 条在索引但位置靠后。这个比例只能说明这批样本里收录问题更集中,不能直接推出全站收录率,也不能证明是某个模板导致的。它的价值在于告诉你:下一步该先处理收录,而不是先改文案。
这种情况下,额度应花在能暴露页面重叠的词上。多个词若都指向同一个页面,说明这个词组的信息量集中在页面承接能力,而不是词本身。
具体动作:把目标词按意图或主题分组,每组抽 5 到 8 个词,只查这些词当前由哪个页面承接、该页面是否唯一。
这里要注意一个例外:如果词组本身搜索意图差异很大,即便指向同一页面也不算异常,此时不应据此拆页。判断依据是意图是否一致,而不是词面是否相似。
额度有限时,样本要满足三点:能区分原因、能覆盖不同模板或目录、能让你在查完后做出一个明确动作。随机抽样通常做不到第三点,因为它可能只告诉你“情况有好有坏”,却不指向下一步。
一个可执行的最小动作是:先抽 10 条,记录每条属于哪一类问题,再决定是否扩大样本。如果 10 条里 8 条都指向同一类问题,扩大样本的边际信息量就低;如果两类问题各占一半,才值得再抽一批来确认边界。
样本里某项指标为零,不能单独证明处理正确。例如抽到的页面都不在索引,可能是抽样偏向了新页面,也可能是站点地图本身过期,还可能是查询口径只覆盖了部分目录。这些都需要用另一个动作去排除,而不是直接下结论。
同样,样本里位置靠后的页面占多数,不能推出全站排名差,也不能推出某个改动有效。有限样本的作用是缩小下一步的排查范围,不是替代完整数据。把这一点写进你的记录里,后续扩大额度时才不会重复查同一批对象。