排查重复页面,核心是判断百度究竟把哪个网址当作“代表页”。先在百度搜索框输入 site:你的域名,再配合页面标题或正文中的独有句子做二次搜索,观察返回的是主网址还是参数页、打印页、分页或旧域名。若同一内容有多个网址同时出现,或代表页不是预期网址,就属于需要处理的重复页面问题。注意,收录数量变化会受抓取周期和搜索需求影响,不能只看一次结果就下结论。
重复页面通常来自三种情况,处理方式不同:
?utm_source= 的推广链接、HTTP 与 HTTPS 同时可访问、带与不带 www 的域名同时返回同一内容。先判断属于哪一类,再决定用 301 跳转、canonical 还是 robots 限制。若只是页面内少量文字相同,但主体信息、价格、库存或评论明显不同,通常不应直接合并。
百度搜索技巧里最直接的动作是组合查询。假设一篇文章标题是“春季跑步鞋选购”,你可以依次执行:
site:example.com 春季跑步鞋选购,记录所有返回网址。site:example.com 搜索,看是否出现其他网址。如果多个网址都返回相同标题和摘要,优先检查页面 <link rel="canonical"> 是否指向同一个主网址。canonical 是提示而非强制指令,百度仍可能根据自身判断选择代表页,因此还要确认主网址本身可正常访问、没有被 robots 屏蔽、没有返回错误状态码。
按下面清单逐项核对,可以快速缩小范围:
www 是否 301 到 www,且只保留一个方向。/page 与 /page/ 是否返回同一内容;若相同,应统一跳转或 canonical。判断结果时,不要只看 canonical 写了什么。实际验收信号是:再次用 site: 查询时,同一内容返回的代表网址趋于一致;带参数的变体不再大量出现在结果中;主网址在抓取记录中持续被访问,而不是只剩变体页被抓取。
完成跳转或 canonical 调整后,至少观察一个完整的抓取周期。比较前后数据时,要考虑季节、搜索需求和采集差异,不能把一次波动直接归因于重复页面修复。可执行以下检查:
site:example.com 页面独有句子 复查,看返回网址是否收敛。如果重复来自其他站点采集你的内容,优先保证自己的主网址先被百度发现,并在正文中保留可识别的时间、作者或品牌信息。跨站重复无法靠单方面 canonical 完全解决,但可以通过持续更新和内部链接强化主版本。
下一步,挑一个已被索引的参数页或分页,按上面的清单核对状态码、canonical 和跳转关系,记录修改前的搜索返回网址,再在下一个抓取周期后复查是否收敛到主网址。