让你秒懂apache禁止网络爬虫采集的方法

来源：互联网发布：淘宝v3会员是什么级别编辑：程序博客网时间：2024/04/26 15:42

导读Apache是世界使用排名第一的Web服务器软件。它可以运行在几乎所有广泛使用的计算机平台上，由于其跨平台和安全性被广泛使用，是最流行的Web服务器端软件之一。它快速、可靠并且可通过简单的API扩充，将Perl/Python等解释器编译到服务器中。同时Apache音译为阿帕奇，是北美印第安人的一个部落，叫阿帕奇族，在美国的西南部。也是一个基金会的名称、一种武装直升机等等。

Apache中禁止网络爬虫，之前设置了很多次的，但总是不起作用，原来是是写错了，不能写到Dirctory中，要写到Location中Apache中禁止网络爬虫，之前设置了很多次的，但总是不起作用，原来是写错了，不能写到Dirctory中，要写到Location中

<Location />SetEnvIfNoCase User-Agent "spider" bad_botBrowserMatchNoCase bingbot bad_botBrowserMatchNoCase Googlebot bad_botOrder Deny,Allow#下面是禁止soso的爬虫Deny from 124.115.4. 124.115.0. 64.69.34.135 216.240.136.125 218.15.197.69 155.69.160.99 58.60.13. 121.14.96. 58.60.14. 58.61.164. 202.108.7.209Deny from env=bad_bot</Location>

SetEnvIfNoCase User-Agent "spider" bad_bot

这是禁止了所有包含spider字符的爬虫。
如果要针对性的禁止爬虫，改成精确匹配的爬虫字符串，如果bingbot、Googlebot等等

本文转载自：http://www.linuxprobe.com/apache-network-collection.html
免费提供最新Linux技术教程书籍，为开源技术爱好者努力做得更多更好：http://www.linuxprobe.com/

0 0