网站首页 >> 资讯 >> 正文
标题

网站SEO中的爬虫陷阱是怎么回事,你的网站可能在无意中浪费蜘蛛的抓取时间

3℃  
内容

爬虫陷阱不是黑客攻击——是你网站自己在浪费搜索引擎的抓取预算。常见的场景是蜘蛛在你的网站上爬到了一个看似正常的URL,然后跟着里面的链接继续爬,但这些链接指向的都是没有实质内容或者说内容高度重复的页面,而且这个路径似乎没有尽头。

网站SEO中的爬虫陷阱是怎么回事,你的网站可能在无意中浪费蜘蛛的抓取时间

最常见的爬虫陷阱类型

无限筛选链接。比如一个电商网站的产品列表页里有一堆筛选参数——按照价格排序、按照颜色筛选、按照尺寸筛选——这些筛选组合是无限的。蜘蛛看到这些链接会跟着一直点,但筛选出来的页面内容本质上都是相同产品的不同排列。

日历链接。网站里有个日历插件,每一个日期都是一个可点击的链接。蜘蛛会顺着这些日期链接一天一天地爬,即使这些页面跟正常的分类页和文章页没有关系。日期的组合是无限的。

站内搜索结果页。蜘蛛在网站里看到了站内搜索框,它不能输入文字所以不一定能触发搜索。但如果搜索URL里有参数组合,蜘蛛可能会大量请求带不同参数的搜索结果页——而这些页面几乎没有独立的搜索价值。

怎么治理爬虫陷阱

用robots文件屏蔽爬虫陷阱路径。日历页面、搜索结果页面、筛选参数组合页面——这些页面不让蜘蛛去爬。

把网站内部链接中不需要被抓取的链接加上nofollow标签。日历的日期链接、搜索链接都可以加nofollow让你宝贵的抓取预算用在真正有价值的内容上。

如果网页上有链接参数集合用canonical标签指定标准URL,告诉搜索引擎这些不同参数的版本本质上是同一个页面。

爬虫陷阱排除之后的收益

蜘蛛不再把抓取预算浪费在无限循环的无效页面上,会把节省下来的访问次数用在你的核心内容上。重要的新内容也会更快被发现和收录。在VP导航(vpis.cn)上的入口让蜘蛛快速进入核心页面而不用沿途被陷阱消耗。排除爬虫陷阱不是高大上的技术,但效果很实在。