先给结论:如果升级后只有评分数字变化、而站点本身没有改动,最合理的解释通常是评分口径变了,不是站点突然变差或变好。能否沿用新评分,取决于你能否拿到同一批样本在新旧规则下的对照结果;拿不到对照,就只能把新分当参考,不能当结论。
评分前后不一致,原因通常落在三个层面,处理方式完全不同。
区分方法很直接:找一批你没有动过的对照站点。如果它们在升级后也同步变动,规则或采集口径变化的可能性就高;如果只有你动过的站点变,才更可能是站点自身问题。
上面这套判断有一个前提:新旧评分针对的是同一批可比样本。一旦样本不可比,结论就会反过来。
假设你升级前查的是首页,升级后工具默认改查整站,或者样本页从 50 个变成 500 个。此时分数下降可能只是覆盖面变大,把原本没被计入的问题页纳入了统计。这种情况下,即便对照站点也在降,也不能推断是规则变严——两组数据根本不在同一个分母上。
同理,如果升级同时改了统计周期(例如从近 7 天改成近 30 天),那么一个刚做过内容清理的站点,分数反而可能因为旧问题被重新计入而下降。这不是规则变严,是时间窗口把历史问题拉回来了。
判断样本是否可比,看两点就够:统计对象是否一致(首页还是整站)、统计范围是否一致(页数、周期、设备)。这两点任一不同,前后分差就不能直接相减。
假设某工具升级后,你手上 20 个站点里有 15 个分数下降。这是假设示例,用于说明比较方法,不代表任何真实工具的表现。
这一步的实际动作是建立分项对照表。它的结果会直接决定下一步:如果差异集中在口径,你不需要改站点,只需要更新内部对分数的解读标准;如果差异集中在站点,才需要进入排查。
很多团队的麻烦不在解释差异,而在两套分数同时存在于同一份报告里。旧分用来做基线,新分用来做当前状态,两者相减得出的“变化”没有意义。
可行做法是选一个切换日:切换日之前的历史数据保留,但标注为旧口径;切换日之后统一用新口径重新建立基线。跨口径的趋势线要么断开,要么用同一批站点在新口径下回算一遍再连。回算如果做不到,就在报告里明确写成两段,不要连成一条线。
这个动作的后果很实际:短期看起来趋势断了,但后续任何一次比较都建立在同一口径上,不会再出现“分数变了但说不清为什么”的情况。
先做对照,再决定是否重设基线,顺序不能反。因为如果先按新分重设了基线,而后来发现差异其实来自采集范围变化,那么新基线本身也是错的,等于把一次口径波动固化成了标准。
这套方法适用于你手上有可重复查询的样本、且能记录分项数据的情况。如果你只有单次查询结果、没有历史分项记录,那么前后差异无法归因,此时唯一稳妥的做法是:把新分当作当前状态的描述,暂时不做趋势判断,等积累到两次以上同口径数据再比较。具体工具的评分构成、样本范围和查询条件,需要以该工具当期公开的说明为准。