赞
踩
菜鸟自学python记录
初级爬虫学习(在B站上看的“黑马程序员180分钟轻松获取疫情数据,Python爬虫入门课”,此次是自己跟着写的简易代码)
import requests from bs4 import BeautifulSoup import re import json # 请求,获取需要解析的文本 response = requests.get('https://ncov.dxy.cn/ncovh5/view/pneumonia') home_page = response.content.decode() # 从HTML中提取数据 soup = BeautifulSoup(home_page,'lxml')#lxml为解析器 scrip = soup.find(id="getListByCountryTypeService2true") # 输出为json格式 text = scrip.text # 从json中使用正则解析提取世界各国的疫情信息 json_str = re.findall(r'\[.+\]',text)[0] #将json格式转换为python文件 data = json.loads(json_str) # 打开文件,并写入,json文件命名为spider.json with open('D:/python/spider.json','w',encoding='utf-8') as fp: # 将python文件存入json文件中 json.dump(data,fp,ensure_ascii=False)
查找id标签的过程截图
最后json结果部分截图
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。