先给结论:小样本有效、批量无效,通常不是操作本身失效,而是样本挑选、页面同质程度、生效观察窗口或执行一致性发生了变化。要复现,第一步不是扩大批量,而是把“有效”的那次操作拆成可核对的执行条件,再判断这批页面是否真的满足这些条件。若满足,改写后重试;若不满足,保留小样本结论、退出批量,或只对条件相近的子集分批处理。
小样本往往不是随机抽取的。常见情况是:先挑了内容较完整、已有一定抓取基础、或本身竞争度较低的页面做试验,效果好;批量时把大量薄弱页面一起纳入,结果被稀释。这两类页面在操作前就不同,不能直接比较。
区分办法是回看试验样本的入选标准:
实际动作:把试验页面和批量页面按同一组字段(内容长度区间、是否有独立主体段、模板是否相同、内链位置是否一致)列成对照。若两组在这些字段上明显不同,优先怀疑样本偏差,而不是急着改操作本身。这个判断会直接决定下一步:偏差明显时应缩窄批量范围,而不是否定方法。
小样本常常是手工逐页处理,批量则依赖模板、脚本或统一规则。手工时你会自然照顾每页的差异,批量时这些差异被抹平,效果自然不同。
可核对的证据包括:
这里可以做一个注明假设的短例子:假设你手工给 10 个页面各补了一段与搜索意图直接相关的说明,效果可见;批量时用模板给 500 个页面插入同一段通用文字。若这 500 个页面主题差异很大,通用文字对多数页面并不匹配,结果自然不如小样本。此时正确动作是保留“补说明”的思路,但改回按主题分组、分组内再套用相近表述,而不是直接放弃操作。
小样本改动少,观察时容易把注意力集中在少数页面上;批量改动多,数据波动来源也变多。一次改动前后比较必须考虑季节、搜索需求变化和数据采集差异,否则容易把无关波动当成操作结果。
判断时至少区分三种解释:
请求量、抓取量或某项统计归零,不能单独证明处理正确,也不能单独证明操作失败——它可能来自采集口径变化、抓取预算调整或站点结构变动。实际动作是:固定同一采集口径,拉长观察窗口,并记录同期是否还有其他改动。若无法排除同期干扰,就不要用这组数据做保留或退出的最终决定。
三种取舍各有适用前提,不必都走一遍。
无论选哪种,下一步都应回到“条件是否一致”这个问题上:条件一致就继续验证,条件不一致就先缩范围。复现的关键不是重复动作,而是重复动作成立的前提。