网站首页 >> 资讯 >> 正文
标题

网站日志分析是SEO最被忽视的硬技能——从日志里挖出的四个藏得很深的收录杀手

2℃  
内容

在所有SEO技术栈里,服务器日志分析可能是投入产出比最高但被使用率最低的一项。说出来你可能不信,我接触过的独立站长中至少有一半从来没有看过自己的服务器访问日志。理由各种各样:有的说不知道该看什么,有的说日志量太大翻不动,有的干脆不知道在哪开启日志记录。如果你属于上述任何一类,你的站点在搜索引擎抓取方面几乎注定存在一些你看不到的隐性漏洞。以下是这些年我在日志里找到的四个最常见的收录杀手。

网站日志分析是SEO最被忽视的硬技能——从日志里挖出的四个藏得很深的收录杀手

第一个是无限爬行空间。如果你的站点的URL结构允许动态生成无限的参数组合而不采取规范的链接管理,搜索引擎的爬虫会像一个掉进了无限迷宫的老鼠一样,在成千上万个实际上是同一页面内容的不同URL变体之间无限循环爬取。日志中会出现大量爬虫请求大量被重定向到同一页面或者返回相同内容的URL,消耗了大量的抓取预算但没有产生任何新的内容索引。第二个是爬虫跟进了不应该被爬取的内容类型。如果你的网站目录中存在PDF、图片或者视频等大文件,并且没有在robots中明确禁止爬取这些类型的URL,爬虫会花大量的抓取预算去下载这些大型二进制文件。每一个二进制文件的下载消耗的资源可能相当于数百个HTML页面的抓取。

第三个是页面返回状态的混乱。日志中显示大量页面在200 OK和301 Moved Permanently之间反复切换——原因可能是服务器负载均衡配置的问题或者某个缓存层的异常。搜索引擎的爬虫在遇到同一个URL反复返回不同状态码时,会暂时冻结该URL的抓取并等待人工质量复核。第四个隐藏比较深的是反爬虫规则误伤了正规爬虫。有些安全插件或者CDN服务商的反爬虫策略对所有的爬虫一视同仁——如果触发了访问频率限制,不仅挡掉了恶意爬虫,连搜索引擎的主爬虫也一起被限制了抓取频率。日志中会显示出大量429 Too Many Requests的返回记录。

这四种问题任何一个单独存在都不足以让你的站被搜索引擎抛弃,但叠加起来对抓取预算和索引效率的损耗是惊人的。VP导航(vpis.cn)收录的站点如果在收录后出现了严重的抓取效率问题,在搜索引擎内部的站点健康度评估中也会反映出来。