大数据处理时我们经常会遇到数据倾斜的问题,尤其是在数据量过大时,数据倾斜可能会导致各种各样的问题。Hadoop数据倾斜主要表现为:ruduce阶段卡在99.99%,而且是一直99.99%不能结束。
具体来说就是:mapreduce程序执行时,reduce节点大部分已经执行完毕,但是其中会有一个或者几个reduce节点运行速度很慢,从而使得整个程序的处理时间很长。原因是:某一个key的条数比其他key多出太多,因此这条key所在的reduce节点所处理的数据量就比其他节点就大很多,这也就造成了某几个节点迟迟运行不完。由于Hive是分阶段执行的,map处理数据量的差异,取决于上一个stage的reduce输出,因此将数据均匀的分配到各个reduce中,这一点是解决数据倾斜的关键。
1.Hadoop框架的特性
B、Jobs 数多的作业运行效率会相对比较低
C、countdistinct、group by、join等操作,触发了Shuffle动作,导致全部相同key的值聚集在一个或几个节点上,很容易发生单点问题。
2.具体原因
A:key 分布不均匀,某一个key的条数比其他key多太多
B:业务数据自带的特性
C:建表时考虑不全面
D:可能某些 HQL 语句自身就存在数据倾斜 问题
1、从业务和数据方面解决数据倾斜
(1)有损的方法:找到异常数据。
(2)无损的方法:
对分布不均匀的数据,进行单独计算
首先对key做一层hash,把数据打散,让它的并行度变大,之后进行汇集
(3)数据预处理
2、Hadoop平台的解决方法
(1)针对join产生的数据倾斜
A.大表和小表join产生的数据倾斜
a.在多表关联情况下,将小表(关联键记录少的表)依次放到前面,这样能够触发reduce端减少操作次数,从而减少运行时间。
b.同时使用Map Join让小表缓存到内存。在map端完成join过程,这样就能省掉redcue端的工作。需要注意:这一功能使用时,需要开启map-side join的设置属性:set hive.auto.convert.join=true(默认是false)
还可以对使用这个优化的小表的大小进行设置:set hive.mapjoin.smalltable.filesize=25000000(默认值25M)
B.大表和大表的join产生的数据倾斜
a.j将异常值赋一个随机值,以此来分散key,均匀分配给多个reduce去执行
b.如果key值都是有效值的情况下,需要设置以下几个参数来解决
set hive.exec.reducers.bytes.per.reducer = 1000000000
也就是每个节点的reduce,其 默认是处理数据地大小为1G,如果join 操作也产生了数据倾斜,那么就在hive 中设定
set hive.optimize.skewjoin = true;
set hive.skewjoin.key = skew_key_threshold (default = 100000)
(2)group by 造成的数据倾斜
解决方式相对简单:
hive.map.aggr=true (默认true) 这个配置项代表是否在map端进行聚合,相当于Combiner
hive.groupby.skewindata
(3)count(distinct)或者其他参数不当造成的数据倾斜
A.reduce个数太少
set mapred.reduce.tasks=800
B.HiveQL中包含count(distinct)时
使用sum...group byl来替代。例如select a,sum(1) from (select a, b from t group by a,b) group by a;
数据分析咨询请扫描二维码
数据挖掘是现代企业利用数据驱动决策的重要工具。它涉及从大量数据中提取隐藏的、先前未知但潜在有用的信息,依托人工智能、机器 ...
2024-10-23在当前数据驱动的商业环境中,数据分析师的角色变得越来越重要。想要踏入这一领域并取得成功,不仅需要扎实的技术基础,还需要不 ...
2024-10-23数据分析是一个广泛而又精细的领域,它结合了统计学、计算机科学、商业策略以及数据科学等多个学科的知识。这个领域日新月异的发 ...
2024-10-23在现代企业中,数字化管理师扮演着至关重要的角色。他们不仅帮助企业优化资源配置,还推动企业的数字化转型。要成为一名合格的数 ...
2024-10-23大数据专业是一个跨学科的领域,涵盖了数学、统计学、计算机科学与技术等多个学科。随着数据在各个行业中的重要性日益增加,大数 ...
2024-10-23大数据分析师培训教程-2.1 Hadoop入门-Hadoop 1.0 的局限与 Hadoop 2.0(YARN)的革新 Hadoop简介Hadoop 的生态系统HDFS 的原理 ...
2024-10-232024,您是否渴望在数据领域探索更广阔的职业机遇? 数字化时代,数据量级每年都在呈指数级增长。据统计,全球互联网用户每天产 ...
2024-10-21数据科学专业是一门跨学科的综合性学科,涵盖了数学、统计学、计算机科学等多个领域。其核心目标是通过数据的收集、处理和分析来 ...
2024-10-21Python是一种高级解释性编程语言,由Guido van Rossum于1991年创造。凭借其简单易学、代码可读性强和功能强大的特点,Python已经 ...
2024-10-21在当今数据驱动的世界中,选择学习Hadoop已成为许多数据分析师和IT专业人士的必修课。Hadoop不仅是大数据处理领域的核心技术之一 ...
2024-10-21数据开发工程师在当今数据驱动的世界中扮演着至关重要的角色。他们不仅负责数据的采集和处理,还在数据仓库建设、系统开发和数据 ...
2024-10-20在当今快速变化的数字经济时代,数字化转型已经成为企业实现持续增长和竞争优势的关键。数字化转型不仅仅是技术的变革,更是组织 ...
2024-10-19在当今快速发展的科技时代,数字经济已成为全球经济的重要组成部分。选择数字经济专业,不仅能为你打开通往多个行业的大门,还能 ...
2024-10-18学习统计学与大数据分析具有显著的优势,能够帮助你走向高薪岗位。在数字化时代背景下,统计学和大数据分析展现出强大的就业潜力 ...
2024-10-18在当今的数字时代,数据科学与大数据技术专业的就业方向极为广泛,涵盖了多个领域和岗位。随着数据成为企业决策的重要依据,行业 ...
2024-10-18大数据技术与应用领域正在迅速发展,成为现代经济和科技发展的重要驱动力。随着数据量的爆炸式增长,各行各业对大数据专业人才的 ...
2024-10-18在当今数据驱动的商业环境中,数据分析软件已成为企业决策过程中不可或缺的工具。随着数据量的激增和分析需求的复杂化,选择合适 ...
2024-10-18在当今数据驱动的世界中,数据分析已成为许多行业不可或缺的一部分。无论是企业决策、市场营销,还是产品开发,数据分析都能提 ...
2024-10-18数据分析在现代企业中扮演着至关重要的角色,帮助企业在竞争激烈的市场中做出明智的决策。随着数据量的不断增长,企业需要依赖先 ...
2024-10-18CDA(Certified Data Analyst)认证在数据分析领域具有显著的作用,具体包括以下几个方面: 1. 专业技能认可 CDA认证是数据分析 ...
2024-10-17