我是靠谱客的博主 矮小小蝴蝶,最近开发中收集的这篇文章主要介绍apache禁止搜索引擎收录、网络爬虫采集的配置方法,觉得挺不错的,现在分享给大家,希望可以做个参考。

概述

Apache中禁止网络爬虫,之前设置了很多次的,但总是不起作用,原来是是写错了,不能写到Dirctory中,要写到Location中

复制代码 代码如下:

<Location />
SetEnvIfNoCase User-Agent "spider" bad_bot
BrowserMatchNoCase bingbot bad_bot
BrowserMatchNoCase Googlebot bad_bot
Order Deny,Allow
#下面是禁止soso的爬虫
Deny from 124.115.4. 124.115.0. 64.69.34.135 216.240.136.125 218.15.197.69 155.69.160.99 58.60.13. 121.14.96. 58.60.14. 58.61.164. 202.108.7.209
Deny from env=bad_bot
</Location>

这是禁止了所有包含spider字符的爬虫。
如果要针对性的禁止爬虫,改成精确匹配的爬虫字符串,如果bingbot、Googlebot等等

最后

以上就是矮小小蝴蝶为你收集整理的apache禁止搜索引擎收录、网络爬虫采集的配置方法的全部内容,希望文章能够帮你解决apache禁止搜索引擎收录、网络爬虫采集的配置方法所遇到的程序开发问题。

如果觉得靠谱客网站的内容还不错,欢迎将靠谱客网站推荐给程序员好友。

本图文内容来源于网友提供,作为学习参考使用,或来自网络收集整理,版权属于原作者所有。
点赞(82)

评论列表共有 0 条评论

立即
投稿
返回
顶部