我是靠谱客的博主 野性水蜜桃,最近开发中收集的这篇文章主要介绍scrapy无法循环抓取,觉得挺不错的,现在分享给大家,希望可以做个参考。

概述

最近在学习scrapy,写好了大概的样子,但是却发现无法循环抓取,最后自己想着以前貌似有个例子说过原因。

  • 之前写的如下:
name = 'dmoz'
allowed_domains = ['dmoz.org']
start_urls = ['http://www.123.info/']
  • 修改之后如下:
name = 'dmoz'
allowed_domains = ['123.info']
start_urls = ['http://www.123.info/']

为了实现yield当前站循环抓取,需要将allowed_domains改为与url一致的域名才行,也就是如果想抓取123.info的全站链接,需要将allowed_domains设置为123.info就可以通过Request实现循环抓取了

最后

以上就是野性水蜜桃为你收集整理的scrapy无法循环抓取的全部内容,希望文章能够帮你解决scrapy无法循环抓取所遇到的程序开发问题。

如果觉得靠谱客网站的内容还不错,欢迎将靠谱客网站推荐给程序员好友。

本图文内容来源于网友提供,作为学习参考使用,或来自网络收集整理,版权属于原作者所有。
点赞(39)

评论列表共有 0 条评论

立即
投稿
返回
顶部