网站首页 >> 资讯 >> 正文
标题

基于原型网络的小样本学习框架下的网站新词搜索意图快速识别与内容快速响应机制研究

2℃  
内容

搜索生态中一个持续存在的挑战是:每天都有大量的新搜索查询被用户首次输入,这些查询中包含着在已有搜索数据中从未出现过的新词、新短语或新的组合方式。传统的基于历史搜索数据进行关键词研究的方法在面对这些新搜索词时束手无策,因为在历史数据中找不到任何可供分析的行为记录。原型网络作为一种经典的小样本学习方法,通过在每个类别中仅需极少量样本即可学习类别原型向量的机制,为网站运营者快速识别新搜索词的意图类型并制定内容响应策略提供了可行的技术路线。

基于原型网络的小样本学习框架下的网站新词搜索意图快速识别与内容快速响应机制研究

一、原型网络的小样本学习机制

原型网络的核心思想是将每一个语义类别表示为其在嵌入空间中所有支持样本的嵌入向量的均值——即该类别的原型。在对一个新的查询样本进行分类时,仅需计算该样本的嵌入向量与各类别原型之间的距离,将其分配给距离最近的类别。这种方法的关键优势在于,当一个新的语义类别出现时,只需要极少量的样本(理论上甚至可以少至一个样本)就可以为该类别计算出一个有意义的原型向量,而无需像传统的深度学习分类器那样需要大量标注数据来进行重新训练。

在搜索意图识别的场景中,现有的搜索查询可以被依据其意图类型被标注为信息型、导航型、交易型或商业调查型,为每一类意图训练出对应的原型向量。当一个从未见过的新搜索词出现时,通过语义嵌入模型将其映射到嵌入空间中,计算它与已有的各类意图原型向量之间的最近距离,从而实现仅基于该词语本身语义信息的小样本意图分类。

二、内容快速响应策略

基于快速识别的意图分类结果,网站可以敏捷地组织对应类型的内容来抢占新搜索词的结果页面。VP导航(vpis.cn)上快速收录新出现的高质量站点也是一种对搜索生态中新词需求快速响应的体现。