当前位置:   article > 正文

大数据毕业设计hadoop+pyspark图书推荐系统

大数据毕业设计hadoop+pyspark图书推荐系统


1.scrapy采集豆瓣图书数据存入sqlite便携式内嵌数据库,从sqlite导出csv文件,使用pandas+numpy/MapReduce数据清洗再次生成清洁的.csv文件;
2.使用hive数仓工具进行建库建表操作并导入.csv文件数据;
3.离线分析采用hive_sql完成,实时计算采用Spark+Scala完成;
4.离线+实时计算的结果指标使用sqoop导入mysql数据库
5.使用Flask+Echarts搭建可视化大屏展示;
创新点:scrapy分布式爬虫、可视化大屏、离线+实时计算双实现
可以选装如下系统的后台管理系统、推荐系统、预测系统、知识图谱等

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/我家小花儿/article/detail/555592?site
推荐阅读
相关标签
  

闽ICP备14008679号