谈谈百度如何辨别原创文章的

2012/5/25 10:32:04   阅读:5434    发布者:5434

一、首先要明确SEO中的两个词:原创伪原创
原创:简单地理解就是第一次在网络上发表的内容,以前没有出现过的内容。
伪原创:就是从网站找来资料进行二次加工,二次修改之后的内容,如修改标题,修改内容,增加些文字或者减少一些文字等。
搜索引擎对于原创的判断是如何进行的呢?
一般来讲有以下几个方面的因素决定:
1、快照日期。
2、蜘蛛抓取日期。
3、页面外链的多少。
4、文章修改的程度。
举个例子如果我在我的网站www.yanet.cn更新了一篇文章新闻。搜索引擎来到这个网站并且抓取到了这篇文章,放到数据库,并且在收录数据库中没有发现类似内容,那么就会被认为是原创。
在这点上有个细节需要注意:
1、访问时间
如果蜘蛛先访问了B站呢?
1、当然权重给B站,一般的情况下都会这样!
2、如果B站转载的文章带了A站的原文章页面链接呢?
3、这就很明白了,刚收录的时候,如果排名,两条结果一起出现,有可能还是B站的排名好一点。
当然,文章转载次数多了以后,A站的链接越多,对A站的文章越有好处,排名会慢慢变成A站在前面。
如果另外转载的文章带的是B站页面的链接呢?
它们如果判断不好,就变成了一个链接流行度的比赛了。
不过,如果都有很多外部链接,并且相差不大,那么判断的规则应该回到原点,谁先被收录谁就是原创。
2、伪原创
伪原创也会被认为是原创?
大多时候是这样的,搜索引擎蜘蛛不能明确分别这些东西,因为它的思维太程式化了。如果你的标题改过,文章的段落改过,那么蜘蛛将很难确定这篇文章是否有过收录,也许它可以确定有部分内容是重复的,但它也不能因为这些而将这篇文章确认为是转载!当然,随着搜索引擎程式设计的提高,应该会有一个相似度的东西出来,比如文字内容相似度超过百分之几就会被认为是转载。
另外提几个建议:
1、如果你的站是新站,权重不高,如何让蜘蛛首页找到你的页面并放入数据库?其实很简单:用网摘、bd收藏这些工具让蜘蛛更快的找到你的页面!
2、大家都有过建议,就是加上自己的版权及内容页面的地址,别人采集的时候你就爽了,收录虽然不会快,但最后链接多了,你依然是原创内容。
3、发表文章等到自己收录以后再去其它的站点进行发表,同时加上自己的原文地址,这种办法很有保障!

3、快照日期
快照日期显示时间最早的,一般就是原创了吧!
不一定,这个说法要在一个更新周期之内,比如说文章发表后一周内,快照时间越早的地址将越有被认可为原创的可能。4:文章被转载
如果刚发表的一篇文章被其它转载了,那么谁是原创呢?那要看谁更先被搜索引擎抓取到,也就是更新周期的问题了。如果在www.yanet.cn发表 被 www点XXX点com转载,如果先抓取到前者站,那么归a,如果先抓取b站,那么原创就归b站了,所以不是说你先发表了,原创就是你的,这个得看搜索引擎什么时间收录了你的内容。
5:文章收录
文章必须被收录,如果没有被收录,肯定是在搜索数据库中石找不到的,搜索引擎根本就找不到这篇文章,更谈不上什么原创了。