当前位置:   article > 正文

Spark入门介绍_spark ppt

spark ppt

Spark自从2014年1.2版本发布以来,已成为大数据计算的通用组件。网上介绍Spark的资源也非常多,但是不利于用户快速入门,所以本文主要通从用户的角度来介绍Spark,让用户能快速的认识Spark,知道Spark是什么、能做什么、怎么去做。

Spark是什么

摘用官网的定义:

Spark是一个快速的、通用的分布式计算系统。

提供了高级API,如:Java、Scala、Python和R。

同时也支持高级工具,如:Spark SQL处理结构化数据、MLib处理机器学习、GraphX用于图计算、Spark Streming用于流数据处理。

也就是说Spark提供了灵活的、丰富接口的大数据处理能力。下图是Spark的模块图:

 

用户使用的SQL、Streaming、MLib、GraphX接口最终都会转换成Spark Core分布式运行。

目前用户用的比较多的是SQL和Streaming,这里先主要介绍下这两个。

Spark SQL

Spark SQL是Spark提供的SQL接口,用户使用Spark SQL可以像使用传统数据库一样使用SQL。例如:创建表、删除表、查询表、join表等。连接到Spark SQL后可以做如下操作

 

# 在Spark中创建一个表:test_parquet,表的存储文件格式为:parquetcreate tabletest_parquet(idint,    namestring,valuedouble)usingparquet;

此命令运行完毕后,Spark系统会在hdfs上创建一个名称为test_parquet的目录,例如/user/hive/warehouse/test_parquet/。

然后往Spark表中插入数据。

如果你准备入行大数据,关于2019大数据目前的

【发展前景】戳我阅读

【就业岗位】戳我阅读

【大数据薪资待遇】戳我阅读

【完整的学习

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/weixin_40725706/article/detail/443282
推荐阅读
相关标签
  

闽ICP备14008679号