大数据框架之Hadoop：HDFS（一）HDFS概述_hdfs外表

作者：weixin_40725706 | 2024-06-07 15:25:41

踩

hdfs外表

HDFS 产生背景

随着数据量越来越大，在一个操作系统存不下所有的数据，那么就分配到更多的操作系统管理的磁盘中，但是不方便管理和维护，迫切需要一种系统来管理多台机器上的文件，这就是分布式文件管理系统。HDFS 只是分布式文件管理系统中的一种。
HDFS 定义

HDFS (Hadoop Distributed File System)，它是一个文件系统，用于存储文件，通过目录树来定位文件，其次，它是分布式的，由很多服务器联合起来实现其功能，集群中的服务器有各自的角色。

HDFS 的使用场景: 适合一次写入，多次读出的场景，且不支持文件的修改。适合用来做数据分析，并不适合用来做网盘应用。

1）高容错性

5c745dd9-7355-4509-86da-ae14c31650d0

2）适合处理大数据

3）可构建在廉价机器上，通过多副本机制，提高可靠性

1）不适合低延时数据访问，比如毫秒级的存储数据，是做不到的。

2）无法高效的对大量小文件进行存储

3）不支持并发写入、文件随机修改

hdfsarchitecture

1）NameNode (nn) :就是Master，它是一个主管、管理者。

2）DataNode: 就是Slave。NameNode下达命令，DataNode执行实际的操作。

3）Client: 就是客户端

4）SecondaryNameNode: 并非NameNode的热备。当NameNode挂掉的时候，它并不能马上替换NameNode并提供服务.

HDFS中的文件在物理上是分块存储（Block），块的大小可以通过配置参数（dfs.blocksize）来规定，默认大小在Hadoop2.x和Hadoop3.x版本中是128M，老版本Hadoop1.x中是64M。

2ec88d43-6e49-4d8c-8a79-2fe7c8bfc898

HDFS文件块大小设置主要取决于磁盘传输速率，目前通过Namenode对HDFS元数据进行寻址的时间约为10ms，即查找到目标block的时间为10ms。

寻址时间为传输时间的1%时，则为最佳状态

因此，传输时间为10ms/0.01=1000ms=1s

目前磁盘的传输速率普遍为100MB/s

因此，block大小为1s*100MB/s=100MB

因为电脑底层数据采用二进制存储，所以目前的block块官方大小设置为128MB。

总结：HDFS文件块大小设置主要取决于磁盘传输速率，生产中采用高速磁盘作为存储介质的可以考虑在HDFS的配置文件中设置dfs.blocksize参数调整block块大小。

HDFS的块设置太小，会增加寻址时间，程序一直在找块的开始位置；

如果块设置的太大，从磁盘传输数据的时间会明显大于定位这个块开始位置所需的时间。导致程序在处理这块数据时，会非常慢。

声明：本文内容由网友自发贡献，不代表【wpsshop博客】立场，版权归原作者所有，本站不承担相应法律责任。如您发现有侵权的内容，请联系我们。转载请注明出处：https://www.wpsshop.cn/w/weixin_40725706/article/detail/685924