apache禁止网络爬虫采集

凉白开 Apache213,9454字数 478阅读1分35秒阅读模式

Apache中禁止网络爬虫,之前设置了很多次的,但总是不起作用,原来是是写错了,不能写到Dirctory中,要写到Location中

<Location />
SetEnvIfNoCase User-Agent "spider" bad_bot
BrowserMatchNoCase bingbot bad_bot
BrowserMatchNoCase Googlebot bad_bot
Order Deny,Allow
#下面是禁止soso的爬虫
Deny from 124.115.4. 124.115.0. 64.69.34.135 216.240.136.125 218.15.197.69 155.69.160.99 58.60.13. 121.14.96. 58.60.14. 58.61.164. 202.108.7.209
Deny from env=bad_bot
</Location>
SetEnvIfNoCase User-Agent "spider" bad_bot

这是禁止了所有包含spider字符的爬虫。
如果要针对性的禁止爬虫,改成精确匹配的爬虫字符串,如果bingbot、Googlebot等等文章源自运维生存时间-https://www.ttlsa.com/apache/apache-disable-spaider/ 文章源自运维生存时间-https://www.ttlsa.com/apache/apache-disable-spaider/

weinxin
我的微信
微信公众号
扫一扫关注运维生存时间公众号,获取最新技术文章~
凉白开
  • 本文由 发表于 20/02/2014 00:10:31
  • 转载请务必保留本文链接:https://www.ttlsa.com/apache/apache-disable-spaider/
评论  2  访客  2
    • 默北
      默北 6

      网站跟目录下扔一个robots.txt文件

        • 小人物
          小人物 9

          @ 默北 爬虫软件可以设置不遵从robot.txt协议

      评论已关闭!