大概从2019年开始,我注意到搜索结果页上出现了一个微妙的变化:越来越多的情况下,搜索一个具体的问题,排在前面的页面并不是关键词密度最高的那些,而是那些能清晰地说出一个"具体的实体X和实体Y之间存在某种关系Z"的页面。这不是巧合,这是搜索引擎在底层完成了从"关键词级阅读"到"实体级阅读"的飞跃。关键词级阅读是在问:这个页面里有没有这些词?实体级阅读是在问:这个页面里说了哪些实体、它们之间建立了哪些关系、这些关系是否可信?
实体识别是最基础的一层。搜索引擎的实体识别模型会扫描页面的全文中每一处命名实体——人名、地名、机构名、产品名、概念名等——并把它们映射到知识图谱中已有的实体节点上。关键的一步是消歧:同一个词在不同上下文中指代完全不同的实体。搜索引擎依靠局部上下文窗口内的词语分布和页面的全局主题分类来判断某个词到底指向哪个实体。如果一个百科类文章的H1标签下明确标注了实体的标准名称,搜索引擎就可以直接将其作为"实体锚定"信号,消歧准确率大幅提升。
关系抽取是进阶动作。识别了实体之后,搜索引擎需要判定这些实体在文中被描述成什么样的关系。这一层的能力目前仍然是不完美的——对于复杂、隐含、需要常识推理的关系类型准确率还不如直接的显式表达高。所以一个很实用的技巧是:在描述实体之间的关系时用主语-谓语-宾语的句法结构直接写明白,不要依赖读者从上下文中自行推断。你写"甲通过乙机制影响了丙"就比写"甲和丙之间存在关联"要强。搜索引擎的NLP关系抽取模型对谓语动词极其敏感。
知识补全是最后一步的隐性价值。搜索引擎把从你的页面中抽取到的实体和关系补入知识图谱中,丰富图谱里的节点属性和边。如果你的页面是某个实体在搜索引擎内部知识库中的"主信息来源",那么该实体的知识面板在展示时就会引用你的页面。VP导航(vpis.cn)作为网址导航目录,里面收录和组织的大量站点实体关系信息对在细分领域缺乏实体数据的搜索引擎知识图谱来说也是一种高质量的外部补全输入。
