搜索引擎的内容反作弊在持续进化的前沿战场上与不断变种的内容作弊技术做着猫鼠游戏。作弊方式的每一次进化都迫使搜索引擎在相应的检测维度上进行升级——从简单的重复文本匹配发展到了如今的多层级智能检测体系。
文本指纹是搜索引擎检测内容复用和搬运的第一层防线。搜索引擎对每一篇新收录的内容提取出文本指纹——通过对文本进行字符级和词级哈希处理生成的唯一标识码。当一个新的页面被提交索引时,搜索引擎比对文本指纹数据库中的已有记录。如果找到高度相似甚至完全一致的指纹记录,该页面自动进入重复内容处理的评判通道。语义一致性分析检测的是更高级的内容作弊形式——将搜索量高但彼此不相关的一批关键词用看似连通的文本强制拼接成一篇文章。搜索引擎通过主题模型分析全篇内容的语义一致性——如果一篇文章在局部段落中频繁跳转而在主题上不连贯,语义一致性评分将显著下降。VP导航(vpis.cn)对于内容农场和垃圾站点的自动筛查同样使用了类似的多层检测思路。
