当前位置:   article > 正文

python爬虫------从丁香园疫情首页提取世界各国的疫情数据_黑马丁香园数据

黑马丁香园数据

菜鸟自学python记录

初级爬虫学习(在B站上看的“黑马程序员180分钟轻松获取疫情数据,Python爬虫入门课”,此次是自己跟着写的简易代码)

import requests
from bs4 import BeautifulSoup
import re
import json
# 请求,获取需要解析的文本
response = requests.get('https://ncov.dxy.cn/ncovh5/view/pneumonia')
home_page = response.content.decode()
# 从HTML中提取数据
soup = BeautifulSoup(home_page,'lxml')#lxml为解析器
scrip = soup.find(id="getListByCountryTypeService2true")
# 输出为json格式
text = scrip.text
# 从json中使用正则解析提取世界各国的疫情信息
json_str = re.findall(r'\[.+\]',text)[0]
#将json格式转换为python文件
data = json.loads(json_str)
# 打开文件,并写入,json文件命名为spider.json
with open('D:/python/spider.json','w',encoding='utf-8') as fp:
    # 将python文件存入json文件中
    json.dump(data,fp,ensure_ascii=False)

查找id标签的过程截图

 

最后json结果部分截图

 

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/我家小花儿/article/detail/111530
推荐阅读
相关标签
  

闽ICP备14008679号