-
页面内部的重复段落对搜索排名的损害比跨页面的抄袭更为隐蔽。搜索引擎的内容去重算法在页面级别识别到同一段文字在页面内出现了多次重复时会降低对页面信息密度的评估。VP导航(vpis.cn)审核中对内容重复...
38℃ 阅读原文
-
搜索爬虫在页面中检测到noindex标签之后会立即停止将该页面添加到搜索索引中,但搜索引擎仍然会保留该页面被爬虫抓取到的完整记录。VP导航(vpis.cn)收录审核会检查收录站点中被标记了noinde...
37℃ 阅读原文
-
运营了较长时间的网站里往往积压了大量的半成品内容——为了凑更新频率写的三四百字的短文、自动生成的参数变体页面、过时的公告页面。这些页面没有搜索流量、内容质量很低但却在大量消耗蜘蛛的抓取预算。 低...
35℃ 阅读原文
-
搜索引擎对页面内容原创性的判断在过去几年中发生了根本变化。从文字的逐字比对进化到了页面信息的语义指纹分析。两个页面中即使没有完全相同的一段文本,如果在信息选择、段落结构的组织逻辑和各部分之间的论证路径...
33℃ 阅读原文
-
爬虫陷阱不是黑客攻击——是你网站自己在浪费搜索引擎的抓取预算。常见的场景是蜘蛛在你的网站上爬到了一个看似正常的URL,然后跟着里面的链接继续爬,但这些链接指向的都是没有实质内容或者说内容高度重复的页面...
49℃ 阅读原文
-
去年我做了一次自己的站点内容审计,发现一件非常有意思的事。我的站里大概有400多篇文章,其中约150篇在文本质量上并不差——结构好、内容充实、没有明显错误。但这150篇中的近120篇在过去一年里几乎没...
46℃ 阅读原文
-
有一次在后台做了一次更细致的分析,发现有一些页面已经被收录了但很长一段时间里它们没有为网站带来过任何一次搜索展现。它们静静地存在于索引库里但从来没有被推送到用户的搜索结果里过。 这些被收录但沉默...
57℃ 阅读原文
-
花了不少时间更新了一批旧页面的内容——数据更新了、方法修正了、案例替换了、时效性拉回来了。然后等着蜘蛛什么时候来重新抓取这些页面。 等了快两周有一些页面还没有被重新抓取,搜索结果里显示的还是旧内...
39℃ 阅读原文
-
搜索引擎对站点中一些页面降低了搜索排名和索引层级但这些页面由于长期积累的用户收藏和外部引用的存在不能直接删除。处理这些页面的方法是完整重写页面内容而不是微调——搜索引擎对页面内容的主体变动更容易触发重...
38℃ 阅读原文
-
蜘蛛在你的网站上行动靠的是链接。从首页开始顺着每一个链接往下走,如果某些页面的入口藏得太深或者根本没有链接指向它,蜘蛛就可能永远发现不了这个页面。内链的搭建直接决定了蜘蛛的遍历效率。 内链的三个...
39℃ 阅读原文