我是靠谱客的博主 野性水蜜桃,这篇文章主要介绍scrapy无法循环抓取,现在分享给大家,希望可以做个参考。

最近在学习scrapy,写好了大概的样子,但是却发现无法循环抓取,最后自己想着以前貌似有个例子说过原因。

  • 之前写的如下:
name = 'dmoz'
allowed_domains = ['dmoz.org']
start_urls = ['http://www.123.info/']
  • 修改之后如下:
name = 'dmoz'
allowed_domains = ['123.info']
start_urls = ['http://www.123.info/']

为了实现yield当前站循环抓取,需要将allowed_domains改为与url一致的域名才行,也就是如果想抓取123.info的全站链接,需要将allowed_domains设置为123.info就可以通过Request实现循环抓取了

最后

以上就是野性水蜜桃最近收集整理的关于scrapy无法循环抓取的全部内容,更多相关scrapy无法循环抓取内容请搜索靠谱客的其他文章。

本图文内容来源于网友提供,作为学习参考使用,或来自网络收集整理,版权属于原作者所有。
点赞(48)

评论列表共有 0 条评论

立即
投稿
返回
顶部