Spark入门介绍_spark ppt

作者：weixin_40725706 | 2024-04-18 01:24:51

踩

spark ppt

Spark自从2014年1.2版本发布以来，已成为大数据计算的通用组件。网上介绍Spark的资源也非常多，但是不利于用户快速入门，所以本文主要通从用户的角度来介绍Spark，让用户能快速的认识Spark，知道Spark是什么、能做什么、怎么去做。

Spark是什么

摘用官网的定义：

Spark是一个快速的、通用的分布式计算系统。

提供了高级API，如：Java、Scala、Python和R。

同时也支持高级工具，如：Spark SQL处理结构化数据、MLib处理机器学习、GraphX用于图计算、Spark Streming用于流数据处理。

也就是说Spark提供了灵活的、丰富接口的大数据处理能力。下图是Spark的模块图：

用户使用的SQL、Streaming、MLib、GraphX接口最终都会转换成Spark Core分布式运行。

目前用户用的比较多的是SQL和Streaming，这里先主要介绍下这两个。

Spark SQL

Spark SQL是Spark提供的SQL接口，用户使用Spark SQL可以像使用传统数据库一样使用SQL。例如：创建表、删除表、查询表、join表等。连接到Spark SQL后可以做如下操作

# 在Spark中创建一个表：test_parquet，表的存储文件格式为：parquetcreate tabletest_parquet(idint, namestring,valuedouble)usingparquet;

此命令运行完毕后，Spark系统会在hdfs上创建一个名称为test_parquet的目录，例如/user/hive/warehouse/test_parquet/。

然后往Spark表中插入数据。

如果你准备入行大数据，关于2019大数据目前的

【发展前景】戳我阅读

【就业岗位】戳我阅读

【大数据薪资待遇】戳我阅读

【完整的学习

本文内容由网友自发贡献，转载请注明出处：【wpsshop博客】