📦 归档笔记 — 原创建于 WizNote,仅作归档展示;观点以当年为准,非最新。

2-2srcapy的介绍、组件、数据流

创建时间2019-06-22最后修改2019-06-22原位置/程序员成长之旅/Python学习/爬虫学习/字数653图片/附件4
目录:程序员成长之旅/Python学习/爬虫学习

2-2srcapy的介绍、组件、数据流

  1. 框架图

  2. 🖼 图片占位(归档模式)图片见原始导出:2-2srcapy%E7%9A%84%E4%BB%8B%E7%BB%8D%E3%80%81%E7%BB%84%E4%BB%B6%E3%80%81%E6%95%B0%E6%8D%AE%E6%B5%81.assets/1557835565486.png
  3. 翻译、作用

  4. Scrapy Engine 引擎

1. 负责Scheduler、Downloader、Spiders、Item Pipeline 之间的中间的通讯信号的传递和数据传送,相当于一个通讯站。
  1. Scheduler 调度器
1. 简单来说就是一个队列。负责接收爬虫发过来的Requests请求,并将其排队,当引擎需要数据的时候就将请求队列的数据交给引擎。
  1. Downloader 下载器
1. 负责发送请求并下载数据,下载所有引擎发送过来的Requests请求,并将Responses交还给引擎,最后再由请求交还给Spiders。
  1. Spiders 爬虫
1. 爬虫策略。
  1. Item Pipeline 管道
1. 封装去重类、存储类的地方,处理Spiders获取到的数据,进行后期处理。
  1. Downloader Middlewares 下载中间件
1. 自定义扩展组件,可以放代理或者其他手段隐藏自己等。
  1. Spider Middlewares 爬虫中间件
1. 可以自定义扩展Spider到引擎之间的数据。
  1. 工作方式

  2. 传递入口URL

NoData

Requests

OK

Fail

More

ltems

开始爬虫

Scrapy Engine

Scheduler

结束爬虫

Downloader

Spiders

ltem Pipeline 2.

附件