京公网安备 11010802034615号
经营许可证编号:京B2-20210330
Hadoop有一个名为“HDFS”的分布式文件系统,它的设计目的是提供一个高容错,且能部署在廉价硬件的分布式系统;它的设计参照了Google的GFS(Google分布式文件系统);它能支持高吞吐量,适合大规模数据集应用。
HDFS上的文件被划分为以固定块大小的多个分块(默认为64MB,如此大是为了最小化寻址开销),每个块作一个独立的存储单元。
这样做有两个好处:第一可以存储容量大于单一磁盘容量的文件;第二大大简化了存储子系统的设计(只需要管理块,而且块的元数据并不需要与块一同存储)。将每个块复制到少数几个独立的机器上(默认为3个),可以确保在块、磁盘或机器发生故障后数据不会丢失(即发现一个块不可用,系统会从其他地方读取另一个复本,同时重新复制该复本到一台正常的机器上)。下图展示了这些特性。
HDFS集群由一个NameNode(管理者)和多个dataNode(工作者)组成。HDFS解决了单点问题,HDFS集群的管理者是非常重要。NameNode管理文件系统的命名空间,它维护着文件系统树及整颗树内所有的文件和目录,同时也记录着每个文件中各个块到DataNode。同时,NameNode(管理者)包含主要节点(Primary)和备份节点(Stand by),如果Primary出现问题,Stand By可自动接替Primary继续工作。DataNode主要负责响应文件系统客户端发出的读写请求,同时还将在NameNode的指导下负责执行文件的创建、删除以及复制。
Hadoop的MapReduce(分布式计算模型)处理框架正是基于HDFS构建,它充分利用集群的并行优势来处理存储在HDFS上的数据文件。一个MapReduce任务在集群上以任务跟踪(TaskTracker)执行。每个TaskTracker被Job监控,当发现一个TaskTracker执行失败是,JobTracker就会将该任务分配到其他机器上运行。
在运行MapReduce作业经常会遇到各种问题,为了能进行必要的优化,理解HDFS原理还是很有必要的。下面介绍比较常见的一种情况:小文件如何拖累MapReduce作业及可采取的优化措施。
在MapReduce作业中,Hadoop将其输入数据划分成等长的小数据块,称为输入分片。Hadoop为每个分片构建一个map任务,或者说每一个map操作只处理一个输入分片。每个分片被划分为若干个记录,每条记录就是一个键值对,map一个接一个地处理记录。输入分片包括自己的大小和存储位置,存储位置供MapReduce系统将map任务尽量放在分片附近,分片大小用于排序分片,以便优先处理最大的分片,从而最小化作业运行时间。
在一般的MapReduce作业中,使用最多的输入数据格式通常是存储在HDFS上的文件。Hadoop自带的FileInputFormat类是所有使用文件作为其数据源实现的基类。它提供两个功能:一个用于指出作业的输入文件位置;一个是输入文件生成分片的实现代码段。
一个文件如果大于HDFS的块大小,那么它会被分割成多个块,存储在不同的位置。如果分片的大小大于HDFS的块大小,那么一个分片就会从不同位置读取,需要通过网络传输到map任务节点,与使用本地数据运行整个map任务相比,这种方法效率更低。另一方面,如果分片切分得太小,那么管理分片的总时间和构建map任务的总时间将决定作业的整个执行时间。因此,对于大多数作业来说,一个合理的分片大小趋向于HDFS的一个块的大小,即64MB。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
CDA数据分析师 出品 作者:李诗怡 STP模型(营销战略三步法) 定义: 现代营销战略核心框架,通过市场细分(S)、目标市场选择( ...
2026-09-18在互联网产品迭代、运营优化、界面改版与策略升级过程中,主观经验判断容易造成决策偏差、盲目改版、资源浪费等问题。AB实验(AB ...
2026-09-18 很多企业并不缺少指标,缺少的是让指标“串起来、动起来、用起来”的体系。零散指标像散落一地的珠子,指标体系则是那根把珠 ...
2026-09-18在电商行业精细化运营时代,流量红利逐步消退,粗放式投流、广撒网营销模式已无法适配市场竞争需求。依托用户点击、加购、收藏、 ...
2026-09-17在数据可视化与数据分析工作中,图表是将零散数据转化为直观业务规律的核心工具。不同图表拥有专属的数据逻辑与分析维度,能够从 ...
2026-09-17 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标在所有行业都适用”“哪些指标只对电商有意义”“二者如何搭 ...
2026-09-17在企业数字化运营、业务流程管理与精细化管控体系中,流程运营是串联各项业务环节、保障工作落地、提升运转效率的核心载体。无论 ...
2026-09-16在数据分析与统计学研究中,卡方检验是分析分类变量关联性与差异性的重要方法,广泛应用于市场调研、行为统计、社会调查、商业数 ...
2026-09-16 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“什么是指标”“指标和维度有什么区别”“如何定义指标值的计算规则和 ...
2026-09-16CDA数据分析师 出品 作者:李诗怡 定义: 用户增长核心分析框架,刻画用户从接触产品到自发推荐的全生命周期,五个递进环节构建 ...
2026-09-15在数字化营销与精细化用户运营时代,企业传统的广撒网式营销模式成本高、转化率低,已无法适配精准商业竞争需求。客户画像作为大 ...
2026-09-15 很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度” ...
2026-09-15在MySQL数据库数据查询与数据分析中,GROUP BY与ORDER BY是使用频率极高的核心关键字。二者语法结构相似,常搭配使用,但核心功 ...
2026-09-14随着数字化治理、智慧运营、数字孪生技术的普及,数字体征成为衡量业务状态、系统运行、城市治理与企业经营健康度的核心体系。数 ...
2026-09-14 很多数据分析师沉迷于复杂的模型和算法,却忽略了数据分析的一项基础能力——描述性统计。事实上,大量商业分析问题,用描述 ...
2026-09-14在MySQL数据库运维与开发实践中,经常出现一种典型现象:数据库实际存储的数据量很小,数据表条数少、文件体积低,但服务器整体 ...
2026-09-11 很多数据分析师能熟练计算均值、标准差,但当被问到“总体和样本有什么区别”“参数和统计量有什么关系”“数据级别的高低如 ...
2026-09-11CDA数据分析师 出品 作者:李诗怡 定义: 将同一时间段内因具备相同属性或共同经历的用户划分为群体,分析其留存与生命周期价值 ...
2026-09-11在零售、商超、餐饮、线下门店等实体商业运营中,客流与销售额是衡量门店经营状态的两大核心指标。销售额是门店经营的最终结果, ...
2026-09-10在数据可视化体系中,柱形图是最基础、应用最广泛的图表类型,其中**累计柱形图(堆积柱状图)**是兼顾整体总量与内部结构的核心 ...
2026-09-10