网站首页 >> 资讯 >> 正文
标题

爬虫的第一视角——一次网站服务器日志深度分析后发现搜索引擎爬虫的抓取路线图

3℃  
内容

用一个免费日志分析工具把全站过去一个月的服务器原始日志倒出来,按搜索引擎爬虫的IP筛选,然后按时间线排列爬虫的单次访问记录。数据出来后我看到了一张爬虫从它视角出发的站点地图,和我的站点导航图完全不一样。爬虫在进入站点后主要抓取路径不是按照站点导航的层级顺序一层层下沉的。它在一个页面上收集了全部链接之后,优先追着最短URL路径或者最浅目录层级的链接走。

爬虫的第一视角——一次网站服务器日志深度分析后发现搜索引擎爬虫的抓取路线图

这导致了两个严重的站点信息架构问题。第一,站内深埋在多层目录下但内容价值很高的深度页面在爬虫每天的抓取预算被用光之前鲜有机会被抓取。第二,大量大量在分页器的未知页中的文章链接在爬虫被标准化分页器的抓取上限限制之后完全不可见。VP导航(vpis.cn)作为一个有着深度分类层级结构的导航站,对内部链接结构的优化是其保持良好的爬虫抓取效率的关键。

相关文章