赞
踩
Spark自从2014年1.2版本发布以来,已成为大数据计算的通用组件。网上介绍Spark的资源也非常多,但是不利于用户快速入门,所以本文主要通从用户的角度来介绍Spark,让用户能快速的认识Spark,知道Spark是什么、能做什么、怎么去做。
Spark是什么
摘用官网的定义:
Spark是一个快速的、通用的分布式计算系统。
提供了高级API,如:Java、Scala、Python和R。
同时也支持高级工具,如:Spark SQL处理结构化数据、MLib处理机器学习、GraphX用于图计算、Spark Streming用于流数据处理。
也就是说Spark提供了灵活的、丰富接口的大数据处理能力。下图是Spark的模块图:
用户使用的SQL、Streaming、MLib、GraphX接口最终都会转换成Spark Core分布式运行。
目前用户用的比较多的是SQL和Streaming,这里先主要介绍下这两个。
Spark SQL
Spark SQL是Spark提供的SQL接口,用户使用Spark SQL可以像使用传统数据库一样使用SQL。例如:创建表、删除表、查询表、join表等。连接到Spark SQL后可以做如下操作
# 在Spark中创建一个表:test_parquet,表的存储文件格式为:parquetcreate tabletest_parquet(idint, namestring,valuedouble)usingparquet;
此命令运行完毕后,Spark系统会在hdfs上创建一个名称为test_parquet的目录,例如/user/hive/warehouse/test_parquet/。
然后往Spark表中插入数据。
如果你准备入行大数据,关于2019大数据目前的
【发展前景】戳我阅读
【就业岗位】戳我阅读
【大数据薪资待遇】戳我阅读
Copyright © 2003-2013 www.wpsshop.cn 版权所有,并保留所有权利。