解析搜索引擎的Robots协议

2019独角兽企业重金招聘Python工程师标准>>>

对于初为站长的人来说，robots.txt文件应该是个比较神秘的东西，今天， 济宁辉腾网站建设就为大家来解析一下这个文件。

robots.txt是一种存放于网站根目录下的文本文件，用于告诉搜索引擎的爬虫（spider），此网站中的哪些内容是不应被搜索引擎的索引，哪些是可以被索引。通常认为，robots.txt文件用来搜索引擎对目标网页的抓取。

robots.txt协议并不是一个规范，而只是约定俗成的，通常搜索引擎会识别这个文件，但也有一些特殊情况。

对于Google来说，使用robots也未必能阻止Google将网址编入索引，如果有其他网站链接到该网页的话，Google依然有可能会对其进行索引。按照Google的说法，要想彻底阻止网页的内容在Google网页索引中（即使有其他网站链接到该网页）出现，需要使用noindex元标记或x-robots-tag。例如将下面的一行加入到网页的header部分。

如果Google看到某一页上有noindex的元标记，就会将此页从Google的搜索结果中完全丢弃，而不管是否还有其他页链接到此页。

对于百度来说，情况和Google类似，如果有其他网站链接目标网页，也有可能会被百度收录，从百度的说明页面上看，百度并不支持像Google那样通过noindex完全将网页从索引上删除，只支持使用noarchive元标记来禁止百度显示网页快照。具体的语句如下。

上面这个标记只是禁止百度显示该网页的快照，百度会继续为网页建索引，并在搜索结果中显示网页摘要。

例如，淘宝网目前就通过robots.txt来屏蔽百度爬虫，但百度依旧收录了淘宝网的内容，百度搜索“淘宝网”，第一个结果也是淘宝网首页地址，只是该页面没有网页快照，因此看来，网站只能禁止百度的快照，而无法禁止百度为网页建索引。

再比如， 济宁辉腾网站建设 www.0537web.net 是不屏蔽蜘蛛的，所以目前，百度，google 等搜索引擎会正常收录网站页面。

转载请注明济宁辉腾网站建设 http://www.0537web.net/

转载于:https://my.oschina.net/zhaodong/blog/82070

解析搜索引擎的Robots协议相关推荐

2 爬虫数据解析(bs4，XPath) robots协议 cookie反爬代理反爬
爬虫 1 数据解析 1.1 介绍 1.1.1 概念即作用数据解析就是将一组数据中的局部数据进行提取,用于实现聚焦爬虫. 聚焦爬虫是建立在通用爬虫的基础上,从通用爬虫获取的整个源码数据中提取出指定的数 ...
爬虫：Robots协议
Robots 协议也称作爬虫协议.机器人协议,它的全名叫作网络爬虫排除标准( Robots Exclusion Protocol ),用来告诉爬虫和搜索引擎哪些页面可以抓取,哪些不可以抓取它通常是一 ...
（转）Robots协议（爬虫协议、机器人协议）
Robots协议(也称为爬虫协议.机器人协议等)的全称是"网络爬虫排除标准"(Robots Exclusion Protocol),网站通过Robots协议告诉搜索引擎哪些页面可以 ...
Robots协议（爬虫协议、机器人协议）
Robots协议(也称为爬虫协议.机器人协议等)的全称是"网络爬虫排除标准"(Robots Exclusion Protocol),网站通过Robots协议告诉搜索引擎哪些页面可以 ...
Robots协议写法教程
Robots协议的约束力 "Robots的约束力固然仅限于自律,无强制性,但这不等于说它背后反映的精神,没有法律基础."中国社会科学院信息化研究中心秘书长姜奇平表示,美国的电子隐私 ...
网络爬虫信息提取的常识和Robots协议
网络爬虫介绍在浏览网站中,所能见到的数据可以通过爬虫程序保存下来. 网络爬虫,小规模可以爬取网页,大规模可以爬取网站,或一系列的网站,超大规模的像搜索引擎的这种难以完成,需要定制开发,爬取全网. 网 ...
芝麻HTTP：分析Robots协议
2019独角兽企业重金招聘Python工程师标准>>> 利用urllib的robotparser模块,我们可以实现网站Robots协议的分析.本节中,我们来简单了解一下该模块的用法. ...
网络爬虫学习3 - Requests库的七个主要方法、安全性问题与异常处理、反爬虫和Robots协议
网络爬虫MOOC学习打卡 - 第三天文章目录网络爬虫MOOC学习打卡 - 第三天一.Requests库主要方法解析 0.Requests库的七个主要方法 1.request()方法request ...
robots协议是什么？对网站SEO有什么好处？
在网站优化中,robots协议一直是优化人员重视的细节,想要网站能够有更高的抓取和排名,此协议也起到很大的作用,那么robots协议是什么呢?它对网站的SEO有什么作用和好处呢?下面一起来了解一下. ...

解析搜索引擎的Robots协议

解析搜索引擎的Robots协议相关推荐

最新文章

热门文章