Google 的谷歌t圭主动抓取对象支撑 REP(robots 和谈)。这意味着 ,若何在抓取某一网站之前 ,解读Google 抓取对象会下载并分析该网站的表类 robots.txt 文件 ,以提取关于网站中哪些部分可以被抓取的谷歌t圭信息。REP 不合用于由用户独霸的若何 Google 抓取对象(比如 Feed 订阅),也不合用于用来进步用户安然性的解读抓取对象(比如歹意软件分化) 。
本文引见了 Google 对 REP 的表类解读。有关原始草稿标准的谷歌t圭信息,请搜检 IETF Data Tracker。若何 假定您是解读初度干戈 robots.txt ,请先不雅不雅不雅不雅鉴赏我们的表类 robots.txt 简介。您还可以找到关于成立 robots.txt 文件的谷歌t圭提示,和一个详实的若何罕有问题解答列表。
甚么是解读 robots.txt 文件
假定您不盼看抓取对象访谒您网站中的部非分不凡容 ,可以成立包含照顾轨则的 robots.txt 文件。robots.txt 文件是一个复杂的文本文件,个中包含关于哪些抓取对象可以访谒网站的哪些部分的轨则 。比如 ,example.com 的 robots.txt 文件大年夜大年夜约以下所示:
# This robots.txt file controls crawling of URLs under https://example.com.
# All crawlers are disallowed to crawl files in the "includes" directory, such
# as .css, .js, but Googlebot needs them for rendering, so Googlebot is allowed
# to crawl them.
User-agent:
*Disallow: /includes/
User-agent: Googlebot
Allow: /includes/
Sitemap: https://example.com/sitemap.xml
文件职位和有效局限
您必须将 robots.txt 文件放在网站的***目次中 ,并为其独霸支撑的和谈。就 Google 搜刮而言 ,支撑的和谈包含 HTTP 、HTTPS 和 FTP。独霸 HTTP 和 HTTPS 和谈时,抓取对象会独霸 HTTP 无前提 GET 请求来提取 robots.txt 文件;独霸 FTP 时 ,抓取对象会独霸标准 RETR (RETRIEVE) 呼唤 ,并采取匿名登录编制 。
robots.txt 文件中列出的轨则只合用于该文件地址的主机、和谈和端标语 。
和其他网址一样 ,robots.txt 文件的网址也分辨大年夜小写。
有效 robots.txt 网址的示例
下表列出了 robots.txt 网址及其合用的网址路途的示例。
| robots.txt 网址示例 | |
| http://example.com/robots.txt | 合用于 : http://example.com/ http://example.com/folder/file 不合用于 : http://other.example.com/ https://example.com/ http://example.com:8181/ 这属于一样往常气候。该网址对其他子网域 、和谈或端标语来讲有效。对不合个主机 、和谈和端标语上的全数子目次中的全数文件有效。 |
| http://www.example.com/robots.txt | 合用于: http://www.example.com/ 不合用于 : http://example.com/ http://shop.www.example.com/ http://www.shop.example.com/ 子网域上的 robots.txt 只对该子网域有效 。 |
| http://example.com/folder/robots.txt | 不是有效的 robots.txt 文件。抓取对象不会搜检子目次中的 robots.txt 文件 。 |
| http://www.exämple.com/robots.txt | 合用于: http://www.exämple.com/ http://xn--exmple-cua.com/ 不合用于 : http://www.example.com/ IDN 齐截于其对应的 Punycode 版本 。另请参阅 RFC 3492 。 |
| ftp://example.com/robots.txt | 合用于: ftp://example.com/ 不合用于: http://example.com/ |
| http://212.96.82.21/robots.txt | 合用于: http://212.96.82.21/ 不合用于 : http://example.com/(即便托管在 212.96.82.21 上) 以 IP 地址作为主机名的 robots.txt 只在抓取作为主机名的该 IP 地址时有效 。该 robots.txt 文件真实不会主动对该 IP 地址上托管的全数网站有效 ,但该文件多是共享的,在此气候下,它也可以在共享主机名下独霸 。 |
| http://example.com/robots.txt | 合用于
: http://example.com:80/ http://example.com/ 不合用于: http://example.com:81/ 标准端标语(HTTP 为 80 ,HTTPS 为 443,FTP 为 21)齐截于其默许的主机名。 |
| http://example.com:8181/robots.txt | 合用于: http://example.com:8181/ 不合用于: http://example.com/ 非标准端标语上的 robots.txt 文件只对经由过程这些端标语供给的内容有效。 |
偏向措置和 HTTP 外形代码
在请求 robots.txt 文件时,处事器照顾的 HTTP 外形代码会影响 Google 抓取对象独霸 robots.txt 文件的编制 。下表总结了 Googlebot 针对各类 HTTP 外形代码措置 robots.txt 文件的编制。
| 偏向措置和 HTTP 外形代码 | |
| 2xx(成功) | 展示成功的 HTTP 外形代码会提示 Google 抓取对象措置处事器供给的 robots.txt 文件。 |
| 3xx(重定向) | Google 会屈就 RFC 1945 的端方跟踪起码五次重定向,然后便会停止,并将其作为 robots.txt 的 404 倾素来措置。这也合用于重定向链中任何被阻拦访谒的网址,因为抓取对象会因为重定向而没法提取轨则 。 Google 不会跟踪 robots.txt 文件中的逻辑重定向(框架、Javascript 或元更始型重定向)。 |
| 4xx(客户端偏向) | Google 抓取对象会将全数 4xx 偏向解读为网站不存在有效的 robots.txt 文件
,这意味着抓取将不受限制。 这包含 401 (unauthorized) 和 403 (forbidden) HTTP 外形代码 。 |
| 5xx(处事器偏向) | 因为处事器没法对 Google 的 robots.txt 请求供给了了照顾
,是以 Google 会且则将处事器偏向解读为网站无缺阻拦访谒。Google 会考验考验抓取 robots.txt 文件 ,直到掉落踪掉落踪非处事器所长的 HTTP 外形代码 。503 (service unavailable) 偏向会招致特别很是频繁的重试独霸 。假定延续 30 天以上没法访谒 robots.txt,Google 会独霸该 robots.txt 的末尾一个缓存副本
。假定没有缓存副本,Google 会假定没有任何抓取限制。 假定您需求停歇抓取,建议为网站上的每个网址供给 503 HTTP 外形代码 。 假定我们可以断定,某网站因为设置设备放置禁尽确而在贫窭网页时前去 5xx 而不是 404 外形代码,就会将该网站的 5xx 偏向作为 404 偏向措置。比如 ,假定前去 5xx 外形代码的网页上的偏向消息为"找不到网页" |
