大数据Spark：从入门到实战（附视频教程&项目源码）_bella.spark

作者：AllinToyou | 2024-06-13 07:43:23

踩

bella.spark

本文是由菜鸟窝出品的12天大数据特训营课程摘录出来的，关于大数据spark的入门到实战视频可以戳此查看第三章：https://www.cniao5.com/course/10244

勾搭助教Bella的weixin（BT474849）还可以免费领取大数据独家内部视频资源，项目源码等。

一、Spark简介
1、大数据spark简介：
Spark是大数据相关的最活跃的开源项目，是继 MapReduce框架之后的下一代大数据处理框架。
Spark是一个开源的内存计算框架，类似MapReduce，用于使用商业服务器集群来处理和分析数据。 Spark API允许开发者创建分布式应用程序，使用整个集群的资源，而不需要知道所有底层细节。

2、Spark发展历史
Spark是在Matei Zaharia的博士论文《An Architecture for Fast and General Data Processing on Large Cluster》(大型集群上的快速和通过数据处理架构)的基础上发展而来。

2009年，Spark起源于加州大学伯克利分校的实验室（AMPLab）。
2010年，Spark成为开源项目。 2013年，Spark被捐赠给Apache软件基金会。同年，Databricks公司成立。
2014年，Spark称为Apache的顶级项目

3、Spark版本历史
在这里插入图片描述

二、Hadoop与MapReduce

2.1、MapReduce计算框架的缺点
1.可编程性较差
2.缺乏一个通用计算引擎
3.计算速度慢

2.2. Spark计算框架的优点
1、良好的编程性：
Spark程序比相应的MapReduce应用程序要简单得多。
Spark提供了丰富的API。
与MapReduce相比

声明：本文内容由网友自发贡献，不代表【wpsshop博客】立场，版权归原作者所有，本站不承担相应法律责任。如您发现有侵权的内容，请联系我们。转载请注明出处：https://www.wpsshop.cn/w/AllinToyou/article/detail/711461