有些新手对robots协议文件不是太懂,一边禁止搜索引擎抓取或者无意中错误修改了robots协议文件,这就导致蜘蛛无法抓取你网站内容,也就无法收录,最好到谷歌站长平台工具里的robots中检测一下是否设置正确。 有些新手对robots协议文件不是太懂,一边禁止搜索引擎抓取或者无意中错误修改了robots协议文件,这就导致蜘蛛无法抓取你网站内容,也就无法收录,最好到百度站长平台工具里的robots中检测一下是否设置正确。 robots协议,学名叫:the robots exclusion protocol,就搜索引擎抓取网站内容的范围作了约定,包括网站是否希望被搜索引擎抓取,哪些内容不允许被抓取,把这些内容放到一个纯文本文件robots.txt里,然后放到站点的根目录下。 robots协议:robots.txt是搜索引擎访问一个网站时要访问的第一个文件,用以来确定哪些是被允许抓取的哪些是被禁止抓取的。
网站的robots.txt文件设置是不是合理,哪些文件或许目录需求屏蔽、哪些设置办法对网站运营有优点?有人复制出相同的内容以应付不同搜索引擎的排名规则。然而,一旦搜索引擎发现站内有大量“克隆”的页面,就会给以惩罚,不收录这些重复的页面。另一方面,我们网站的内容属于个人私密文件,不想暴露在搜索引擎中。这时,robot.txt就是为了解决这两个问题。 一、什么是robots.txt 查找引擎运用spider程序主动拜访互联网上的页面并获取页面信息。spider在拜访一个网站时,会首先会查看该网站的根域下是不是有一个叫做robots.txt的纯文本文件,这个文件用于指定spider在您网站上的抓取规划。您能够在您的网站中创立一个robots.txt,在文件中声明该网站中不想被查找引擎录入的有些或许指定查找引擎只录入特定的有些。 二、robots.txt文件对网站有啥优点 1、疾速增加网站权重和拜访量; 2、制止某些文件被查找引擎索引,能够节约服务器带宽和网站拜访速度; 3、为查找引擎供给一个简洁明了的索引环境 三、哪些网站的目录需求运用robots.txt文件制止抓取 1)、图像目录 图像是构成网站的首要组成元素。跟着现在建站越来越便利,许多cms的呈现,真实做到了会打字就会建网站,而正是由于如此便利,深圳SEO网上呈现了许多的同质化模板网站,被重复运用,这样的网站查找引擎是必定不喜爱的,就算是你的网站被录入了,那你的作用也是很差的。若是你非要用这种网站的话,主张你大概在robots.txt文件中进行屏蔽,一般的网站图像目录是:imags或许img; 2)、网站模板目录 如上面图像目录中所说,cms的强大和灵敏,也致使了许多同质化的网站模板的呈现和乱用,高度的重复性模板在查找引擎中形成了一种冗余,且模板文件常常与生成文件高度类似,相同易形成相同内容的呈现。对查找引擎很不友爱,严峻的直接被查找引擎打入冷宫,不得翻身,许多cms有具有独立的模板寄存目录,因而,大概进行模板目录的屏蔽。一般模板目录的文件目录是:templets 3)、css、js目录的屏蔽 css目录文件在查找引擎的抓取中没有用途,也无法供给有价值的信息。所以强烈主张在robots.txt文件中将其进行屏蔽,SEO外包以进步查找引擎的索引质量。为查找引擎供给一个简洁明了的索引环境更易晋升网站友爱性。css款式的目录一般情况下是:css或许style js文件在查找引擎中无法进行辨认,这里仅仅主张,能够对其进行屏蔽,这样做也有一个优点:为查找引擎供给一个简洁明了的索引环境; 4)、屏蔽双页面的内容 这里拿dedecms来举例吧。我们都晓得dedecms能够运用静态和动态url进行同一篇内容的拜访,若是你生成全站静态了,那你有必要屏蔽动态地址的url连接。这里有两个优点:1、查找引擎对静态的url比动态的url更友爱、更简单录入;2、避免静态、动态url能拜访同一篇文章而被查找引擎判为重复内容。这样做对查找引擎友爱性来说是有益无害的。 |
上一篇: 【网络营销策划书】网络推广方法八大分析点
下一篇: 【又名普兰站长网】什么是关键词密度