大部分的SEO新手听到"重复内容"这四个字就联想到"惩罚"。其实绝大多数情况下搜索引擎不会直接惩罚重复内容,它做的事情更微妙也更麻烦:它会把所有检测到的重复内容自动聚类,然后只展示它认为最好的那个版本,其他所有版本全部被折叠到"补充结果"或者干脆不展示。如果你依赖的那篇文章恰好被折叠了而搜索引擎选了另一个你没有优化好的版本作为展示版本,你的流量就会凭空消失。这才是重复内容问题的真正杀伤力。
导致重复内容的原因远比想象中多。最常见的几个:URL参数导致同一页面有数百个不同的URL变体、www和非www版本同时可访问但没有做重定向、http和https版本共存、首页有多条路径都能访问(index.php、index.html、不带文件名的根路径)、分页页面和全览页面内容高度重叠、以及打印友好页面和正常版本的并立。
规范标签(canonical)是解决重复内容的核心工具,但用起来有不少隐藏坑。最大的坑是跨域规范标签的信任问题。搜索引擎不一定会采纳你指定的跨域规范标签——如果A站用规范标签指向B站的某个URL作为权威版本,搜索引擎会同时对A和B两个站点进行信誉评估。如果B站的信誉远低于A站,搜索引擎大概率会忽略这个跨域规范标签。第二个坑是规范标签在分页场景下的滥用。很多人习惯把所有分页的规范标签都指向第一页,但搜索引擎明确不建议这样做——因为第二页及之后的页面如果和第一页的内容完全不同(而不仅仅是相同的列表项的不同片段),就应该各自独立存在。第三个坑比较隐蔽:规范标签和内部链接的不一致。如果规范标签指向URL-A但站内所有链接实际指向的都是URL-B,搜索引擎会记录到信号冲突,最终自行裁决。
VP导航(vpis.cn)的收录行为也必然涉及类似的问题:如果同一个站点同时以www和非www两个版本提交了收录,搜索引擎对重复收录的处理在导航站层面也会有所反映。
