配色: 字号:
蜘蛛怎样判断原创
2012-08-13 | 阅:  转:  |  分享 
  
蜘蛛怎样判断原创

大家都知道搜索引擎喜欢原创的东西,但是我们很多人却有这样的疑问:那就是蜘蛛怎么判断这些东西是不是原创的呢?

一般来讲有以下几个方面的因素决定:

1、蜘蛛抓取日期

2、快照的日期

3、文章修改的程度

4、页面外链的多少

举个例子,如果在自己的网站更新了一篇文章新闻,引擎来到网站并抓取到了这篇文章,放到数据库,并且在收录数据库中没有发现类似内容,就会被认为是原创,在这点上有以下细节需要注意:

一、文章被转载

如果刚发表的一篇文章被其它转载了,那么谁是原创呢?那要看谁更先被搜索引擎抓取到,也就是更新周期的问题了。如果先抓取到前者站,那么归前者,如果先抓取后者站,那么原创就归后者站了,所以不是说你先发表了,原创就是你的,这个得看搜索引擎什么时间收录了你的内容。

二、文章收录

文章必须被收录,如果没有被收录,肯定是在搜索数据库中找不到的,引擎根本就找不到这篇文章,更谈不上什么原创了。

那如果蜘蛛先访问了后者站呢?权重就会给后者站,正常的情况下都是这样的!

如果后者站转载的文章带了前者站的原文章页面链接呢?这就很明白了,刚收录的时候,两条结果一起出现,有可能还是后者的排名好一点。当然,文章转载次数多了以后,前者的链接越多,对前者的文章越有好处,排名会慢慢变成前者在前面。

如果另外转载的文章带的是B站页面的链接呢?如果判断不好,就变成了一个链接流行度的比赛了。不过,如果都有很多外链,并且相差不大,那么判断的规则就会回到原点,谁先收录谁就是原创。三、伪原创

伪原创会被认为是原创吗?大多时候是这样的,引擎蜘蛛不能明确分别这些东西,因为它太程式化。如果你的标题改过,文章的段落改过,那么蜘蛛将很难确定文章是否有过收录,也许它可以确定有部分内容是重复的,但它也不能因为这些而将这篇文章确认为是转载!当然,随着引擎程式设计的提高,应该会有一个相似度的东西出来,比如内容相似度超过百分之几就会被认为是转载。

分析下来,相信大家应该了解了。只是残箫自己的看法,希望大家吸收自己想要的东西,不认同的也来提下自己的意见!

另提几个建议:

1、如果你是新站,权重不高,如何让蜘蛛首页找到你的页面并放入数据库?其实很简单,用网摘、bd收藏等这些工具让蜘蛛更快的找到你的页面!

2、前辈们已经有过建议,就是加上自己的版权及内容页面的地址,别人采集的时候你就爽了,收录虽然不会快,但链接多了,你依然是原创内容。

3、发表文章等到自己收录以后再去其它的站点进行发表,同时加上自己的原文地址,这种办法很有保障!

四、快照日期

快照日期显示时间最早的,一般就是原创了吧?其实不一定,这个说法要在一个更新周期之内,比如说文章发表后一周内,快照时间越早的地址将越有被认为是原创的可能。但如果文章都发表了几个月了,说不定引擎已经重新获取过快照了,快照的日期就变了!

除此之外还有其它的可能,一般比如百度收录,他可能有一个收录的数据库,经过过滤后,收录的内容才会放到搜索结果里来,在这个期间就有一些问题,比如前站首次发表,后者转载,蜘蛛先访问前者再访问后者,而后可能先把后者站的结果放出来了,而前者还在数据库里。所以说引擎没有收录并不表示引擎蜘蛛没有访问过这些内容,也许在引擎的库存里已经有了记录,只是你查的时间没有放出来而已,就像25号才放出来的内容,但是快照是20号的,这就是搜索引擎的库存内容,同时这也是检验原创的核心时间点。

这种情况一般出现在新站与老站之间,前者发表,后者转载,但前站在搜索引擎的信任度并不高的时候,不过只要是前者先被访问到的,原创权还是前者的,这是最难分出来的情况,因为我们不知道蜘蛛先访问哪个站,除非你知道两个站的网站空间日志内容,能看到搜索引擎对两个页面的访问时间。

本文由创业板第一门户——财富创业板整理发布!

献花(0)
+1
(本文系炒股技巧学...首藏)