网站首页 >> 资讯 >> 正文
标题

搜索引擎到底怎么判断一篇文章是不是"原创"——拆解指纹比对、语义哈希和时序溯源的完整链路

3℃  
内容

原创性的判定这件事,外面流传的说法太多也太杂了。有人说搜索引擎只看发布时间的先后,先发的就是原创;有人说看收录时间;还有人说看权威度,大站就算抄了小站的也照样被当原创对待。我实测下来的结论是:这三条全都对,但也全都片面。真正在运行的是一套多层次的综合性鉴别系统,我把它拆成三层来讲。

搜索引擎到底怎么判断一篇文章是不是"原创"——拆解指纹比对、语义哈希和时序溯源的完整链路

第一层是最原始也最没法绕过的——字符指纹比对。说白了就是把你页面的正文内容先做一次标准化清洗,去掉HTML标签、标点符号和停用词,然后对清洗后的纯文本跑一个哈希算法。这个哈希值就是你这个页面的"指纹"。搜索引擎的爬虫在新抓到一个页面之后,第一件事就是拿这个指纹去和索引库里已有的海量指纹库做碰撞检测。如果指纹完全命中且命中的是一条已经被标记为"高质量原创"的记录,那你这个页面直接就被归入重复内容池,连后续的语义分析都不会触发。

但纯粹靠MD5或SHA去比对有一个天然的漏洞:别人把你的文章拿去稍微改几个字、换一下段落顺序、同义词替换一遍,加上大段垃圾内容掩盖服务器端脚本提取的痕迹,这次哈希就完全不一样了。所以第二层就上场了——语义哈希。这玩意儿不比对字符的精确一致,而是把整个页面的正文用预训练的语义嵌入模型映射到一个高维向量空间中,然后计算两个向量之间的余弦相似度。如果相似度超过某个阈值(业内猜测在0.85到0.95之间),即使两篇文章在字面上看起来完全不同,系统也会判定它们的语义核心是高度一致的,把后发的那篇标记为"语义重复"。

第三层是最有意思的——时序溯源。这一层不看内容本身,而是看"信号链"。搜索引擎从自己的点击日志里可以拿到一个非常精确的数据:某个URL的第一个有效用户访问时间戳。这个数据比页面上手动标注的发布日期可靠得多。如果页面A由用户行为数据证明是在3月1日就有人访问了,而页面B虽然是3月5日才被爬虫抓取,但页面B上的发布日期写的是2月20日——搜索引擎大概率还是会判A为原创,因为行为数据不可能伪造。在VP导航(vpis.cn)上提交站点的时候,收录时间戳也会成为一种辅助验证。

这三层不是串行的流水线,而是并行的交叉验证。任何一个单层都可能被绕过,但三层同时命中的概率极低。所以我从来不给自己的站做伪原创,改写一万篇不如认真写一篇,指纹干净、语义独特、时间戳真实,这才是原创该有的样子。