当前位置:   article > 正文

Python大作业——爬虫+可视化+数据分析+数据库(数据分析篇)。_python连接数据库大作业含报告

python连接数据库大作业含报告

一、生成歌词词云

首先我们需要先获取所有爬取到的歌曲的歌词,将他们合成字符串

随后提取其中的中文,再合成字符串

  1. text = re.findall('[\u4e00-\u9fa5]+', lyric, re.S)  # 提取中文
  2. text = " ".join(text)

之后使用jieba进行分词,并将其中分出来的长度大于等于2的词保存

  1. word = jieba.cut(text, cut_all=True)  # 分词
  2. new_word = []
  3. for i in word:
  4.     if len(i) >= 2:
  5.         new_word.append(i)  # 只添加长度大于2的词
  6. final_text = " ".join(new_word)

接下来为生成的词云选择一张好看的图片,就可以开始生成了!

在这里插入图片描述

  1. mask = np.array(Image.open("2.jpg"))
  2. word_cloud = WordCloud(background_color="white", width=800, height=600, max_words=100, max_font_size=80, contour_width=1, contour_color='lightblue', font_path="C:/Windows/Fonts/simfang.ttf", mask=mask).generate(final_text)
  3. # plt.imshow(word_cloud, interpolation="bilinear")
  4. # plt.axis("off")
  5. # plt.show()
  6. word_cloud.to_file(self.keyword+'词云.png')
  7. os.startfile(self.keyword+'词云.png')

WordCloud参数中的contour_width=1, contour_color='lightblue’分别为背景图片轮廓线条的粗细和颜色,如果没有设置则不会出现轮廓,font_path是用来指定字体的

生成后可以通过show展示也可以通过保存到本地并打开,最终结果如下

在这里插入图片描述

二、热门歌手歌曲量饼图

在这里插入图片描述

 首先是获得热门歌手列表以及热门歌手歌曲量

随后用每个歌手歌曲数量除以所有这十个歌手的总歌曲数量,得到每个歌手歌曲量的占比

接下来可以选择设置哪一块突出显示,如图中周杰伦部分突出显示

如下只需要将突出部分的值设置大即可

explode = [0.1, 0, 0, 0, 0, 0, 0, 0, 0, 0]

接下来就可以生成饼图了

  1. plt.figure(figsize=(6, 9))  # 设置图形大小宽高
  2. plt.rcParams['font.sans-serif'] = ['SimHei']  # 解决中文乱码问题
  3. plt.axes(aspect=1)  # 设置图形是圆的
  4. plt.pie(x=proportion, labels=name, explode=explode, autopct='%3.1f %%',
  5. shadow=True, labeldistance=1.2, startangle=0, pctdistance=0.8)
  6. plt.title("热门歌手歌曲量占比")
  7. # plt.show()
  8. plt.savefig("热门歌手歌曲量占比饼图.jpg")
  9. os.startfile("热门歌手歌曲量占比饼图.jpg")

其中x是歌曲量占比的列表,labels是对应的标签(在此图中则为歌手的姓名),explode就是上文提到的突出显示,这三个列表中的各个值是一一对应的,autopct是设置占比数值的显示方式,3.1f则表示占宽为3位(如果大于会原样输出),精度为1的浮点数

同样可以选择直接show展示,或者保存到本地再打开

三、歌曲热度占比条形图

在之前我们通过爬虫获取了top500的歌曲的信息(如下),现在我们希望对歌曲的热度进行分析,生成柱状图

在这里插入图片描述

 效果图如下:

在这里插入图片描述

 本来是想生成歌手拥有热门歌曲数量的柱形图的,但是那个爬取热门歌曲的网站中那些热门歌曲没有对应的歌手,还需要自己再去其他网站获得每首歌曲对应的歌手,太麻烦了就没这么做了,有兴趣的小伙伴可以自己实现一下

首先我们要获得每个热度范围的歌曲数量

下面的data列表就是对应x元组范围的歌曲数量

我们只要通过遍历歌曲热度列表,每次都在其data列表对应热度+1,最终即可得到每个热度范围的歌曲数量

  1. x = ('0-10', '10-20', '20-30', '30-40', '40-50', '>50')
  2. data = [0, 0, 0, 0, 0, 0]

接下来就是创建柱状图,首先解决中文乱码问题

  1. plt.rcParams['font.sans-serif'] = ['SimHei']
  2. plt.rcParams['axes.unicode_minus'] = False

随后即可通过plt.bar创建,其中第一个参数为横坐标数据,第二个参数为纵坐标数据,第三个参数为为柱状图填充颜色,第四个参数为透明度

title,xlabel,ylabel显然就是该柱状图的标题,横坐标和纵坐标的名称

  1. plt.bar(x, data, color='steelblue', alpha=0.8)
  2. plt.title("pop500歌曲热度")
  3. plt.xlabel("歌曲热度范围")
  4. plt.ylabel("歌曲数量")
  5. plt.show()

文章知识点与官方知识档案匹配,可进一步学习相关知识

Python经验分享

学好 Python 不论是就业还是做副业赚钱都不错,但要学会 Python 还是要有一个学习规划。最后大家分享一份全套的 Python 学习资料,给那些想学习 Python 的小伙伴们一点帮助!

Python学习路线

这里把Python常用的技术点做了整理,有各个领域的知识点汇总,可以按照上面的知识点找对应的学习资源。
在这里插入图片描述

学习软件

Python常用的开发软件,会给大家节省很多时间。
在这里插入图片描述

学习视频

编程学习一定要多多看视频,书籍和视频结合起来学习才能事半功倍。
在这里插入图片描述

100道练习题

在这里插入图片描述

实战案例

光学理论是没用的,学习编程切忌纸上谈兵,一定要动手实操,将自己学到的知识运用到实际当中。
在这里插入图片描述
最后祝大家天天进步!!

上面这份完整版的Python全套学习资料已经上传至CSDN官方,朋友如果需要可以直接微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】。

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/Gausst松鼠会/article/detail/690572
推荐阅读
相关标签
  

闽ICP备14008679号