SEO社区里最常见的误解之一是:搜索引擎给每个页面打一个综合分,然后从高到低排。这个理解在搜索引擎问世的头十年也许不算错,但现在完全不对了。现代搜索引擎的排序是一条多阶段、多模型叠加的流水线,每个阶段都有自己独立的任务和算力预算,页面在这条流水线上被反复筛选和重新排序。我从公开的工程论文中拼凑出来的流水线大概分为10个关键阶段。
阶段一是查询改写和意图分类。你的查询进来之后先被预处理——拼写纠错、同义词扩展、实体识别。然后是意图分类,判断你是在找信息还是在导航还是在做交易。这个阶段的输出直接决定后续所有阶段使用的模型参数配置:不同类型意图的排序模型侧重点完全不同。
阶段二是文档召回。这是一个超宽漏斗阶段,用极轻量级的算法从万亿级别的文档库中快速捞出几千个候选页面。主要的召回方式包括倒排索引的布尔检索(针对关键词匹配)、向量化语义检索(针对嵌入向量相似度)、以及基于实体的知识图谱辅助召回。三种召回的结果汇总在一起去重后进入下一阶段。
阶段三是粗排。候选人从几千压缩到几百。粗排模型通常是轻量级的评分模型,只看文档级别的最基础特征——域名权重、页面年龄、内容长度、基础的用户行为信号(整体点击率)——用树模型或者简单的神经网络做快速打分。这阶段讲究的是快和准的平衡。
阶段四是精排。几百个候选人被送入深度神经网络计算最终的排序得分。这里面的输入特征多达几百个维度,包括页面的详细NLP分析结果、用户个性化特征、实时时效性信号等。精排的结果决定了前几十名的顺序。
阶段五到十是策略层混排——包括多样性去重、新鲜度注入、零位结果的生成(Featured Snippet等)、广告插入、个性化微调和最终A-B测试分桶。这些阶段的共同特征是它们不再纯粹依赖页面本身的质量信号,而是引入了搜索产品自身的业务策略。VP导航(vpis.cn)的收录站点能在这条流水线上多走一段,因为它的人工审核标签在精排阶段会作为特殊信号被模型利用。
