scrapy的自动限速(AutoThrottle)扩展

309 阅读 0 评论 204 点赞

我是靠谱客的博主落寞冬瓜，这篇文章主要介绍scrapy的自动限速(AutoThrottle)扩展，现在分享给大家，希望可以做个参考。

该扩展能根据Scrapy服务器及您爬取的网站的负载自动限制爬取速度。

设计目标

更友好的对待网站，而不使用默认的下载延迟0。
自动调整scrapy来优化下载速度，使得用户不用调节下载延迟及并发请求数来找到优化的值。用户只需指定允许的最大并发请求数，剩下的都交给扩展来完成。

扩展是如何实现的

在Scrapy中，下载延迟是通过计算建立TCP连接到接收到HTTP包头(header)之间的时间来测量的。

注意，由于Scrapy可能在忙着处理spider的回调函数或者无法下载，因此在合作的多任务环境下准确测量这些延迟是十分苦难的。不过，这些延迟仍然是对Scrapy(甚至是服务器)繁忙程度的合理测量，而这扩展就是以此为前提进行编写的。

限速算法

算法根据以下规则调整下载延迟及并发数:

spider永远以1并发请求数及 AUTOTHROTTLE_START_DELAY 中指定的下载延迟启动。
当接收到回复时，下载延迟会调整到该回复的延迟与之前下载延迟之间的平均值。

来源：http://scrapy-chs.readthedocs.io/zh_CN/latest/topics/autothrottle.html

最后

以上就是落寞冬瓜最近收集整理的关于scrapy的自动限速(AutoThrottle)扩展的全部内容，更多相关scrapy内容请搜索靠谱客的其他文章。

本图文内容来源于网友提供，作为学习参考使用，或来自网络收集整理，版权属于原作者所有。

点赞(204)

本文分类：python
浏览次数：309 次浏览
发布日期：2024-07-23 07:30:03

相关文章

Mysql调优之慢sql抓取

使用py-spy解决scrapy卡死的问题

使用py-spy解决scrapy卡死的问题

【Scrapy爬虫系列2】性能调优

【Scrapy爬虫系列2】性能调优

软件推荐：多屏协作scrcpy

软件推荐：多屏协作scrcpy

scrapy的自动限速(AutoThrottle)扩展

scrapy的自动限速(AutoThrottle)扩展

提高scrapy的爬取速度一、降低下载延迟二、多线程三、禁用cookies

提高scrapy的爬取速度一、降低下载延迟二、多线程三、禁用cookies

解决Scrapy性能问题——案例六（下载器中请求太少）

解决Scrapy性能问题——案例六（下载器中请求太少）

scrapy报错解决[twisted.internet.error.TimeoutError: User timeout caused connection failure:]

scrapy报错解决[twisted.internet.error.TimeoutError: User timeout caused connection failure:]

评论列表共有 0 条评论

发表评论取消回复

立即
投稿返回
顶部