Apache Spark 是专为大规模数据处理而设计的快速通用的计算引擎。Spark是加州大学伯克利分校的AMP实验室所开源的类Hadoop MapReduce的通用并行框架，拥有Hadoop MapReduce所具有的优点；但不同于MapReduce的是——Job中间输出结果可以保存在内存中，从而不再需要读写HDFS，因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。

3.特点

运行速度快、易用性好、通用性强、随处处理。

4.查询引擎：Impala

1.架构

2.简介

Impala是Cloudera公司主导开发的新型查询系统，它提供SQL语义，能查询存储在Hadoop的HDFS和HBase中的PB级大数据。已有的Hive系统虽然也提供了SQL语义，但由于Hive底层执行使用的是MapReduce引擎，仍然是一个批处理过程，难以满足查询的交互性。相比之下，Impala的最大特点也是最大卖点就是它的快速。

3.特点

查询速度快，无需转化为MR、但是基于内存，计算的数据量不能大于内存。

5.分布式消息系统：Kafka

1.架构

2.简介

Kafka是最初由Linkedin公司开发，是一个分布式、分区的、多副本的、多订阅者，基于zookeeper协调的分布式日志系统（也可以当做MQ系统），常见可以用于web/nginx日志、访问日志，消息服务等等，Linkedin于2010年贡献给了Apache基金会并成为顶级开源项目。

3.特点

解耦、冗余、扩展性、灵活性和峰值处理、可恢复性、顺序保存、缓冲、异步通信。

6.日志收集系统：Flume

1.架构

2.简介

Flume是Cloudera提供的一个高可用的，高可靠的，分布式的海量日志采集、聚合和传输的系统，Flume支持在日志系统中定制各类数据发送方，用于收集数据；同时，Flume提供对数据进行简单处理，并写到各种数据接受方（可定制）的能力。

3.特点

高可靠、可恢复性。

三、结语

以上就是剩余组件的介绍，大家可以先了解一下概念和特点。架构图尽量了解一下，如果没有基础看起来还是很懵的。后面会就组件进行详细的说明，下一篇是Hadoop。

大数据入门系列文章

1.大数据入门-大数据是什么

2.大数据入门-大数据技术概述(一)

如果你觉得这篇文章对您有帮助，请关注点赞加收藏，想要了解更多请关注公众号联系博主，祝您生活愉快，身心健康！

备注：以上资源来自网络，侵删。

声明：本文内容由网友自发贡献，转载请注明出处：【wpsshop】