当前位置:   article > 正文

苦恼怎么获取旅游景区网站数据?利用Scrapy爬虫轻松做到!_爬虫爬取无锡灵山风景区数据

爬虫爬取无锡灵山风景区数据

本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。

实现过程

制作 Scrapy 爬虫需如下四步:

  • 创建项目 :创建一个爬虫项目
  • 明确目标 :明确你想要抓取的目标(编写 items.py)
  • 制作爬虫 :制作爬虫开始爬取网页(编写 xxspider.py)
  • 存储内容 :设计管道存储爬取内容(编写pipelines.py)

我们以爬取去哪儿网北京景区信息为例,如图所示:

创建项目

在我们需要新建项目的目录,使用终端命令 scrapy startproject 项目名 创建项目,我创建的目录结构如图所示:

  • spiders 存放爬虫的文件
  • items.py 定义数据类型
  • middleware.py 存放中间件
  • piplines.py 存放数据的有关操作
  • settings.py 配置文件
  • scrapy.cfg 总的控制文件

定义 Item

Item 是保存爬取数据的容器,使用的方法和字典差不多。我们计划提取的信息包括:area(区域)、si

本文内容由网友自发贡献,转载请注明出处:https://www.wpsshop.cn/w/秋刀鱼在做梦/article/detail/885264
推荐阅读
相关标签
  

闽ICP备14008679号