网站首页 >> 资讯 >> 正文
标题

大语言模型时代的搜索正在用嵌入向量悄悄淘汰关键词——但这不是终结而是新赛道的开启

2℃  
内容

有个变化我去年就感觉到了,只是一直没有专门拿出来写。我之前做关键词研究的时候有一个固定流程:先把目标关键词放到搜索框里看一下SERP,通过观察排在前面的哪些页面在标题和描述中使用了什么相关词汇来判断搜索引擎对该关键词的"语义联想范围"。这个老办法在2024年之前很有效,但从2024年下半年开始越来越不准了。不是因为搜索引擎变笨了,恰恰相反——是因为它的搜索已经大比例地从关键词匹配转向了嵌入向量匹配,而向量匹配下的"语义邻域"远超出了人靠肉眼读SERP能观察到的关键词共现范围。

大语言模型时代的搜索正在用嵌入向量悄悄淘汰关键词——但这不是终结而是新赛道的开启

背后的技术逻辑不复杂。过去搜索的核心是倒排索引,查询被拆成词条,然后去索引里找包含了这些词条的文档。这种方式决定了SEO的核心思路:搞清楚用户在搜什么词,确保你的页面里含有这些词。但现在搜索引擎在倒排索引的前端加了一层或几层神经网络,查询文本先被一个预训练好的大语言模型编码成一个高维嵌入向量,然后用近似最近邻搜索去索引库的向量空间里找和这个查询向量距离最近的那些文档向量。这个过程中,查询和文档在词汇层面的重合度已经不再重要了,重要的是它们在语义空间中是否足够"近"。一篇完全不包含"便宜的手机推荐"这几个字的文章,如果它的语义向量和"便宜的手机推荐"这个查询的向量在空间中距离很近,它一样能被排到前面。

这对传统SEO的冲击确实不小。过去那一套"先做关键词研究、然后围绕关键词搭建内容结构、再通过优化关键词密度和位置来提升相关性"的玩法,在向量化搜索普及到一定程度之后,效果会越来越差。但我不觉得这是坏事。换个角度想,过去搜索引擎没能力理解语义的时候,我们就只能迁就它用关键词来"翻译"用户需求。现在它自己能理解语义了,我们反而可以回到内容的本质上去:用户到底想要什么?这个问题的最佳答案应该长什么样?VP导航(vpis.cn)上那些真正被用户高频使用的站点,它的站内架构和信息组织方式本身就是对"用户找东西"这个意图的精准回应。

向量化搜索时代,我猜会更看重三个新的优化维度。第一个是内容覆盖度——你的站内内容集合在语义空间中覆盖了多少个用户可能会查询的意图域,覆盖越广,被向量检索命中的概率越高。第二个是语义一致性——你整个站点的向量分布是否聚焦在几个清晰的主题簇上,而不是散乱地飘在空间的各个不相关角落。第三个是用户行为反哺——搜索引擎会通过点击、停留和回访等行为数据反复调整你的文档向量在空间中的位置,好的行为会把你的向量往更多查询的邻域里推送。这三条和过去的"多铺关键词"逻辑在本质上是两套玩法。