软件开发培训班 >> 网络技术 >> 网站运营
禁止搜索引擎收录网站内容的几种方法 |
|
本文标签:禁止,搜索引擎 第一种、robots.txt方法 搜索引擎默认的遵守robots.txt协议,创建robots.txt文本文件放至网站根目录下,编辑代码如下: User-agent: * 通过以上代码,即可告诉搜索引擎不要抓取采取收录本网站,注意慎用如上代码:这将禁止所有搜索引擎访问网站的任何部分 。 如何只禁止百度搜索引擎收录抓取网页 1、编辑robots.txt文件,设计标记为: User-agent: Baiduspider 以上robots文件将实现禁止所有来自百度的抓取 。 这里说一下百度的user-agent,Baiduspider的user-agent是什么? 你可以根据各产品不同的user-agent设置不同的抓取规则,以下robots实现禁止所有来自百度的抓取但允许图片搜索抓取/image/目录: User-agent: Baiduspider-image 请注意:Baiduspider-cpro和Baiduspider-ads抓取的网页并不会建入索引,只是执行与客户约定的操作,所以不遵守robots协议,这个就需要和百度的人联系才能解决了 。 如何只禁止Google搜索引擎收录抓取网页,方法如下: 编辑robots.txt文件,设计标记为: User-agent: googlebot 编辑robots.txt文件 搜索引擎默认的遵守robots.txt协议 robots.txt文件放在网站根目录下 。 举例来说,当搜索引擎访问一个网站时,首先会检查该网站根目录中是否存在robots.txt这个文件,如果搜索引擎找到这个文件,它就会根据这个文件里的内容,来确定它抓取的权限的范围 。 User-agent: Disallow:
User-agent: * 禁止所有搜索引擎访问网站的所有部分 User-agent: Baiduspider 禁止百度收录全站 禁止Google收录全站 User-agent: Googlebot User-agent: * 第二种、网页代码方法
另外当我们的需求很怪异的时候,比如下面这几种情况: 1. 网站已经加了robots.txt,还能在百度搜索出来? 因为搜索引擎索引数据库的更新需要时间 。虽然Baiduspider已经停止访问您网站上的网页,但百度搜索引擎数据库中已经建立的网页索引信息,可能需要数月时间才会清除 。另外也请检查您的robots配置是否正确 。如果您的拒绝被收录需求非常急迫,也可以通过投诉平台反馈请求处理 。 2. 希望网站内容被百度索引但不被保存快照,我该怎么做? Baiduspider遵守互联网meta robots协议 。您可以利用网页meta的设置,使百度显示只对该网页建索引,但并不在搜索结果中显示该网页的快照 。和robots的更新一样,因为搜索引擎索引数据库的更新需要时间,所以虽然您已经在网页中通过meta禁止了百度在搜索结果中显示该网页的快照,但百度搜索引擎数据库中如果已经建立了网页索引信息,可能需要二至四周才会在线上生效 。 希望被百度索引,但是不保存网站快照,如下代码解决: <meta name="Baiduspider" content="noarchive"> 常用的一些代码组合: <META NAME="ROBOTS" CONTENT="INDEX,FOLLOW">:可以抓取本页,而且可以顺着本页继续索引别的链接 |