2-2srcapy的介绍、组件、数据流
目录:程序员成长之旅/Python学习/爬虫学习
2-2srcapy的介绍、组件、数据流
框架图
- 🖼 图片占位(归档模式)图片见原始导出:
2-2srcapy%E7%9A%84%E4%BB%8B%E7%BB%8D%E3%80%81%E7%BB%84%E4%BB%B6%E3%80%81%E6%95%B0%E6%8D%AE%E6%B5%81.assets/1557835565486.png 翻译、作用
Scrapy Engine 引擎
1. 负责Scheduler、Downloader、Spiders、Item Pipeline 之间的中间的通讯信号的传递和数据传送,相当于一个通讯站。
- Scheduler 调度器
1. 简单来说就是一个队列。负责接收爬虫发过来的Requests请求,并将其排队,当引擎需要数据的时候就将请求队列的数据交给引擎。
- Downloader 下载器
1. 负责发送请求并下载数据,下载所有引擎发送过来的Requests请求,并将Responses交还给引擎,最后再由请求交还给Spiders。
- Spiders 爬虫
1. 爬虫策略。
- Item Pipeline 管道
1. 封装去重类、存储类的地方,处理Spiders获取到的数据,进行后期处理。
- Downloader Middlewares 下载中间件
1. 自定义扩展组件,可以放代理或者其他手段隐藏自己等。
- Spider Middlewares 爬虫中间件
1. 可以自定义扩展Spider到引擎之间的数据。
工作方式
传递入口URL
NoData
Requests
OK
Fail
More
ltems
开始爬虫
Scrapy Engine
Scheduler
结束爬虫
Downloader
Spiders
ltem Pipeline 2.