参数组合无限增长时,有效地址集合不能靠穷举来定义,只能靠“规则白名单+可索引内容判定”来定义。做法是:先按参数名和取值类型划分,只允许会改变页面主体内容的参数进入可索引集合,其余一律归入不可索引集合;再用规范标签、robots指令或服务端处理让不可索引集合不生成独立可索引页面。判断标准不是“这个URL能不能打开”,而是“它是否代表一个用户会从搜索结果点进来的独立内容”。
旧内容、旧系统或旧合作关系退出时,常见现象是:服务器日志里参数页抓取明显减少,但站内索引数量、搜索结果里的重复变体并没有同步减少。这会让人误以为处理无效,于是继续加码屏蔽,甚至把仍有价值的地址一起挡掉。
两个合理解释需要分开看:
能区分这两种解释的证据是:抽查一批参数地址,看它们返回的状态码、规范标签指向、以及是否仍能被站内链接或站点地图触达。如果规范标签指向主地址、站内链接已移除,但索引仍在,偏向解释一;如果规范标签仍自指、页面仍可正常访问,偏向解释二。
与其问“哪些参数该留”,不如先给有效地址设门槛。一个地址进入可索引集合,应同时满足:
不满足这三条的参数组合,即使能生成页面,也不应进入有效地址集合。这一步的实际动作是产出一张参数规则表,列出参数名、允许取值、对应内容类型和处理方式。规则表确定后,下一步的规范标签、robots指令和服务端处理才有统一依据。
参数组合无限增长时,穷举不可行,白名单可行。白名单只放“会改变主体内容”的参数,例如分类、分页、语言、排序中确实产生不同结果集的少数几种;跟踪、会话、来源标记、时间戳等一律不进白名单。
对白名单外的参数,可选处理方式有三种,适用条件不同:
需要提醒的是,robots.txt的抓取限制不等于可靠的索引移除。被robots.txt挡住的地址,搜索引擎仍可能因外链等原因将其收录为无摘要结果。若目标是让地址退出索引集合,noindex或410通常比单纯屏蔽抓取更直接,但前提是页面仍可被抓取到,否则指令读不到。
假设一个旧系统留下?color=、?size=、?sort=、?ref=四类参数。按上述规则:color和size若产生不同商品集合,可进白名单;sort只改变顺序,跳转到无参数主地址;ref是来源标记,返回410或统一跳转。
执行后要验证的不是“抓取量是否下降”,而是抽查白名单内地址是否仍可索引、白名单外地址是否返回预期状态、规范标签是否指向正确主地址。如果白名单外地址仍返回200且自引用规范,说明服务端处理没生效,下一步应回到规则表检查参数匹配逻辑,而不是继续加robots规则。站点地图只提交白名单内的有效地址,但站点地图不保证收录,它只是入口提示。
旧内容、旧系统或旧合作关系退出,不等于所有相关地址都要移除。可按“内容是否仍有价值”和“地址是否仍被引用”两个维度分开处理:内容仍有价值且被引用的,保留并归入有效地址集合;内容仍有价值但无引用的,保留但考虑合并到主地址;内容已无价值但被引用的,做301到最相关的新地址;内容无价值且无引用的,返回410。
这个决策顺序的实际影响是:它把“参数清理”从一次性的批量操作,变成可复查的规则维护。规则表更新后,新出现的参数组合会自动落入允许或拒绝分支,不再需要每次重新判断。若涉及具体搜索引擎的支持差异,应分别核查其官方文档,因为不同搜索引擎对noindex、robots.txt和规范标签的处理并不一致。HTTPS只是传输层要求,不保证页面安全无漏洞,也不保证排名,不能作为地址是否有效的判定依据。