基于scrapy-redis组件的分布式爬虫
2024-08-25 21:08:51
scrapy-redis组件安装
- 下载scrapy-redis组件:pip install scrapy-redis
- 更改redis配置文件:
注释该行:bind 127.0.0.1,表示可以让其他ip访问redis 将yes该为no:protected-mode no,表示可以让其他ip操作redis
- 基于scrapy-redis组件的分布式爬虫
- scrapy-redis组件中为我们封装好了可以被多台机器共享的调度器和管道,我们可以直接使用并实现分布式数据爬取。
- 实现方式:
1.基于该组件的RedisSpider类
2.基于该组件的RedisCrawlSpider类
分布式实现流程
- 修改爬虫文件中的相关代码
- 将爬虫类的父类修改成基于RedisSpider或者RedisCrawlSpider。
注意:如果原始爬虫文件是基于Spider的,则应该将父类修改成RedisSpider,如果原始爬虫文件是基于CrawlSpider的,则应该将其父类修改成RedisCrawlSpider。 - 注释或者删除start_urls列表,切加入redis_key属性,属性值为scrpy-redis组件中调度器队列的名称
- 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的管道
ITEM_PIPELINES = {
'scrapy_redis.pipelines.RedisPipeline': 400
}
- 在配置文件中进行相关配置,开启使用scrapy-redis组件中封装好的调度器
# 使用scrapy-redis组件的去重队列
DUPEFILTER_CLASS = "scrapy_redis.dupefilter.RFPDupeFilter"
# 使用scrapy-redis组件自己的调度器
SCHEDULER = "scrapy_redis.scheduler.Scheduler"
# 是否允许暂停
SCHEDULER_PERSIST = True
- 在配置文件中进行爬虫程序链接redis的配置
REDIS_HOST = 'redis服务的ip地址'
REDIS_PORT = 6379
REDIS_ENCODING = ‘utf-8’
REDIS_PARAMS = {‘password’:’123456’}
- 开启redis服务器:redis-server 配置文件
- 开启redis客户端:redis-cli
- 运行爬虫文件:scrapy runspider SpiderFile
- 向调度器队列中扔入一个起始url(在redis客户端中操作):lpush redis_key属性值 起始url
最新文章
- CRL快速开发框架系列教程八(使用CRL.Package)
- python之路十四
- DIOCP之DEMO-Echo卡死问题分析
- java 28 - 2 设计模式之 模版设计模式
- win10 google浏览器设置
- [HOWTO] Install Sphinx for A Script Pro
- 多个超链接a 选中的和不选中的两种样式
- 利用Python爬虫爬取淘宝商品做数据挖掘分析实战篇,超详细教程
- 【66】Scanner类用法详解
- IISARR方式整合Tomcat失敗
- F#周报2019年第12期
- tomcat服务器-谷歌等浏览器-加载本地图片等资源-报not allowed to load local resource的错误解决办法。
- linux最靠谱安装python3
- python小练习:读入一个考试得分,判断这个分数是哪个等级,并输出,考虑异常场景
- android -------- Data Binding的使用(二)
- react-native android app名字 app包名、图标和启动图片设置
- 第12月第8天 Retrofit.builder
- 【技术分享会】 @第七期 android开发基础
- the interconversion of String and StringBuilder
- tornado多路由示例
热门文章
- 查看SqlServer连接所使用的端口号
- Deutsch lernen (02)
- 安卓代码迁移:Make.exe: *** [libs/armabi-v7a/gdbserver] Error 1
- 读书笔记「Python编程:从入门到实践」_4.操作列表
- mysql1064问题完美解决
- html 报告页面样式
- 【剑指Offer】33、丑数
- css image-set 让浏览器自动切换1x,2x图片
- 【例题4-3 uva 133】The Dole Queue
- Spring MVC灵活控制返回json的值(自定义过滤字段)