为什么URL需要屏蔽蜘蛛抓取？怎样利用robots.txt 做到？

北京云无限 > SEO优化

为什么URL需要屏蔽蜘蛛抓取？怎样利用robots.txt 做到？

2019/2/19 10:34:54 来源：本站原创

　　对于robots.txt 文件大家都应该有所了解，但是当网站改版或者其他原因需要禁止搜索引擎抓取某些URL时，建站公司应该怎么做?当然是利用robots.txt。此文件使用的是 Robots 排除标准，该标准是一项协议，其中含有一小组命令，用于表明哪些类型的网页抓取工具可以访问您网站的哪些部分。

　　什么样的URL需要robots.txt 禁止搜索引擎蜘蛛抓取呢?

　　1、同时存在动态和静态URL

　　通常情况下很多网站都会对URL进行静态化，但是很多时候在网站的运营过程中，往往导致动态URL也被抓取了，比如营销部门不小心用动态UR L来推广，比如产品部门不小心也用了动态URL，这个时候就会导致两个不一样的URL对应相同的内容，这对搜索引擎来讲是不友好的，也会导致权重的分散，或者导致搜索引擎抓取的页面不是站长需要的，这时候就需要用robots.txt来屏蔽动态的URL了。

　　2、有些内容我们不需要搜索引擎进行抓取

　　大家都知道淘宝不希望被百度抓取，淘宝认为他的商品页面最具价值，不希望百度收录之后导致用户搜索商品到来百度搜索，这样对淘宝来讲是不利益的，所以淘宝就屏蔽了百度的抓取，自然淘宝也少了很多流量。

　　我们有些会员信息，网站程序URL等都不希望被搜索引擎抓取，那么也可以用robots.txt进行屏蔽。

　　利用robots.txt 禁止不想被收录的url的好处?

　　1、重复的URL被屏蔽之后，有利于权重的积累

　　2、屏蔽一些无效的URL能提高搜索引擎的抓取效率，因为搜索引擎到网站的时间是固定的，那么如果有很多无效的URL，对于大型网站来讲，比如几千万级别的，搜索引擎花了大量的时间处理无效的URL，自然对有效的URL处理的时间就会减少，自然就会导致收录有问题。

　　robots.txt的撰写规则：

　　robots.txt文件是一个文本文件，使用任何一个常见的文本编辑器，比如Windows系统自带的Notepad，就可以创建和编辑它[2]。 robots.txt是一个协议，而不是一个命令。robots.txt是搜索引擎中访问网站的时候要查看的第一个文件。robots.txt文件告诉蜘蛛程序在服务器上什么文件是可以被查看的。

　　当一个搜索蜘蛛访问一个站点时，它会首先检查该站点根目录下是否存在robots.txt，如果存在，搜索机器人就会按照该文件中的内容来确定访问的范围;如果该文件不存在，所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面。百度官方建议，仅当您的网站包含不希望被搜索引擎收录的内容时，才需要使用robots.txt文件。如果您希望搜索引擎收录网站上所有内容，请勿建立robots.txt文件。

　　如果将网站视为酒店里的一个房间，robots.txt就是主人在房间门口悬挂的“请勿打扰”或“欢迎打扫”的提示牌。这个文件告诉来访的搜索引擎哪些房间可以进入和参观，哪些房间因为存放贵重物品，或可能涉及住户及访客的隐私而不对搜索引擎开放。但robots.txt不是命令，也不是防火墙，如同守门人无法阻止窃贼等恶意闯入者。

　　User-agent: * 这里的代表的所有的搜索引擎种类，是一个通配符Disallow: /admin/ 这里定义是禁止爬寻admin目录下面的目录

　　Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录

　　Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录

　　Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以”.htm”为后缀的URL(包含子目录)。

　　Disallow: /? 禁止访问网站中所有的动态页面

　　Disallow: /.jpg$ 禁止抓取网页所有的.jpg格式的图片

　　Disallow:/ab/adc.html 禁止爬取ab文件夹下面的adc.html文件。

　　Allow: /cgi-bin/　这里定义是允许爬寻cgi-bin目录下面的目录

　　Allow: /tmp 这里定义是允许爬寻tmp的整个目录

　　Allow: .htm$ 仅允许访问以”.htm”为后缀的URL。

　　Allow: .gif$ 允许抓取网页和gif格式图片

　　对于利用robots.txt 禁止不想被收录的url就介绍到这里，如果您还有什么疑问可以联系我们。

上一篇文章：如何改善进行简单的网站SEO诊断？

下一篇文章：网站优化的基础工作——网站内容和内链应该注意什么？

首页

seo优化

制作网站

APP开发

微信开发

案例

网站优化案例

网站建设案例

APP开发案例

微信开发案例

网站营销

网站优化

SEO技术

排名软件

网站建设

APP开发

微信开发

关于我们

网站优化

制作网站

APP开发

微信开发

案例

网站优化技术

百度SEO教程

关于我们

为什么URL需要屏蔽蜘蛛抓取？怎样利用robots.txt 做到？

SEO优化

网站建设

APP开发

关于我们

微信公众号