京公网安备 11010802034615号
经营许可证编号:京B2-20210330
很多数据分析师沉迷于复杂的模型和算法,却忽略了数据分析的一项基础能力——描述性统计。事实上,大量商业分析问题,用描述性统计就能找到线索。它不追求“预测未来”,而是回答“数据现在是什么样”。
”
小张是一名刚入行的数据分析师。第一次拿到公司销售数据时,面对数万行密密麻麻的数字,他感到无从下手:客户满意度是上升还是下降?销售业绩的波动大不大?哪个客户群体贡献更高?
这些问题看似简单,但如果没有方法,数据就只是一堆数字。
描述性统计分析,正是解决这一困境的基础能力。描述性统计的本质,是用简洁、标准化的方式总结数据特征,核心解决“数据是什么样的”这一问题。它不涉及推断与预测,聚焦于对现有原始数据的客观描述与整理。描述性统计分析通常包括数据的频数分析、集中趋势分析、离散程度分析和分布形态分析,以及一些基本的统计图形。
本文将从CDA知识体系出发,系统拆解描述性统计的三大核心维度、图表工具与实战应用。
描述性统计的核心是通过量化指标揭示数据“是什么”,其指标体系可分为三大维度:集中趋势、离散程度和分布形态。
集中趋势是指数据围绕某一中心值分布的特征,用于描述数据的“平均水平”“典型值”,帮助快速掌握数据的整体概况。常用的集中趋势指标包括:
| 指标 | 定义 | 适用场景 | 注意点 |
|---|---|---|---|
| 均值 | 所有数值之和除以个数 | 数据呈对称分布、无极端值 | 对异常值敏感 |
| 中位数 | 排序后位于中间位置的数 | 数据有极端值或偏态分布 | 反映“中间水平” |
| 众数 | 出现频率最高的数值 | 分类数据或离散数据 | 一组数据可能没有众数或有多个众数 |
在实际业务中,这三个指标往往需要结合解读。例如,某公司员工薪资呈右偏分布(少数高管薪资较高),此时中位数比均值更能反映普通员工的真实薪资水平。如果数据分布对称且无异常值,均值是合适的选择;如果数据存在极端值,中位数更具代表性;如果面对分类数据(如常见的投诉原因、畅销商品品类),众数则更为合适。
离散程度描述的是数据分散的程度,衡量各变量值远离其中心值的程度。它回答“数据之间的差异有多大”这一问题。在CDA认证中,离散程度是风险评估、稳定性分析的重要环节。
常用的离散程度指标包括:
| 指标 | 定义 | 适用场景 | 注意点 |
|---|---|---|---|
| 极差 | 最大值与最小值的差值 | 快速判断数据跨度 | 对异常值敏感 |
| 方差 | 每个数据与均值之差的平方的平均值 | 衡量整体离散程度 | 单位是原单位的平方 |
| 标准差 | 方差的平方根 | 常用的离散程度指标 | 单位与原数据相同 |
| 四分位距(IQR) | Q3与Q1的差值 | 识别异常值 | 反映中间50%的范围 |
| 离散系数 | 标准差与均值的比值 | 比较不同量纲数据的离散程度 | 消除单位影响 |
标准差反映数据与均值的平均偏离程度,值越小说明数据越稳定。例如,某连锁超市的日销售额标准差为2000元(均值5万元),说明销售额波动可控;若标准差达1万元,则需排查门店运营问题。
四分位距可有效识别异常值(超出Q1-1.5IQR或Q3+1.5IQR的数值)。在实际业务中,某金融平台通过四分位距筛选出“贷款金额超过Q3+1.5IQR”的客户,作为高风险群体重点审核。
分布形态描述数据的形状,回答“数据是如何分布的”这一问题。在统计研究中,常常需要利用偏度和峰度来判断数据分布是否符合正态分布假设。
除了数值指标,描述性统计还离不开图表工具。CDA大纲中明确要求掌握以下描述性统计图表:
| 图表类型 | 适用场景 | 说明 |
|---|---|---|
| 直方图 | 展示数值型数据的分布形态 | 观察数据是否呈正态分布,发现异常值 |
| 柱状图 | 比较不同类别的数值大小 | 分类变量对比 |
| 散点图 | 展示两个变量之间的关系 | 相关分析的基础图表 |
| 箱型图(盒须图) | 展示数据的五数概括和异常值 | 快速识别异常值,判断数据对称性 |
| 折线图 | 展示数据随时间的变化趋势 | 时间序列分析的核心图表 |
| 饼图 | 展示各类别占总体的比例 | 分类变量占比分析 |
在业务描述性分析中,箱线图可以快速确认数据的分布以及数据的中位数、四分位数,是数据初探阶段非常实用的可视化工具。直方图则能够显示数据在不同区间内的频率分布情况,直观反映出数据的集中趋势、离散程度以及是否存在偏态或异常值等信息。
在实际分析中,建议先用描述性统计数值指标(均值、标准差、偏度等)快速了解数据的基本特征,再用图表(直方图、箱型图)直观呈现分布形态,两者结合才能全面把握数据的“画像”。
某电商平台运营团队需要了解用户的行为特征,以便制定精准营销策略。他们收集了1000名用户的以下信息:用户ID(分类变量)、性别(分类变量)、会员等级(顺序变量)、年龄(数值变量)、月均消费金额(数值变量)、月均登录天数(数值变量)。
任务:通过描述性统计分析,回答以下问题:
第一步:识别数据类型与数据准备
检查数据质量:年龄为负数或大于120岁需要处理。确认会员等级为顺序变量。
第二步:频数分析与分类变量描述
对于会员等级等分类/顺序变量,使用频数分析:
| 会员等级 | 频数 | 百分比 | 解读 |
|---|---|---|---|
| 普通 | 320 | 32% | 占比最高 |
| 银卡 | 280 | 28% | |
| 金卡 | 250 | 25% | |
| 钻石 | 150 | 15% | 占比最低 |
结论:普通会员占比最高,钻石会员占比最低——提示运营资源可向会员升级转化倾斜。
第三步:集中趋势分析——用户月均消费金额
| 指标 | 数值 | 业务解读 |
|---|---|---|
| 均值 | 1250元 | 平均每位用户月消费1250元 |
| 中位数 | 980元 | 50%的用户月消费低于980元 |
| 众数 | 500元 | 常见的月消费金额为500元 |
发现:均值>中位数,数据呈右偏分布,说明存在少数高消费用户拉高了平均值。运营应重点关注“腰部用户”,而非被少数高消费用户的数据迷惑。
第四步:离散程度分析
第五步:分组对比分析
按性别分组对比月均消费:
| 性别 | 频数 | 均值 | 中位数 | 标准差 |
|---|---|---|---|---|
| 男 | 520 | 1320元 | 1100元 | 620元 |
| 女 | 480 | 1180元 | 950元 | 540元 |
结论:男性用户的平均消费略高于女性,但中位数差距更大,说明男性用户中的高消费群体更突出。
第六步:分布形态分析
第七步:综合分析与业务建议
通过以上分析,可以得出以下业务建议:
这就是一套完整的“变量识别 → 频数分析 → 集中趋势分析 → 离散程度分析 → 分组对比 → 分布形态分析”的描述性统计分析实战流程。
”
很多数据分析师会算均值、标准差,但当被问到“均值和中位数分别适用什么场景”“如何判断数据的分布形态”“不同变量类型应该用哪些统计指标”时,却答不上来。知其然还要知其所以然,这正是CDA认证体系强调统计基础的价值所在。
对CDA数据分析师而言,描述性统计并非单纯的“指标计算”,而是一套标准化的实操逻辑,贯穿数据预处理、初步分析、汇报呈现等多个环节。描述性统计的价值,不在于“会算指标”,而在于“能用指标读懂数据、定位问题、驱动决策”。面对海量表结构数据,无需逐一查看每条记录,通过描述性统计指标,可在短时间内掌握数据的整体概况,快速定位数据异常,为数据清洗和后续深度分析奠定基础。
描述性统计是CDA数据分析师的基础能力,其价值不在于复杂的计算,而在于从基础指标中挖掘业务痛点。通过掌握集中趋势、离散程度、分布形态的核心逻辑,结合图表等辅助工具,分析师可将零散数据转化为决策依据,为企业的精细化运营奠定基础。
下一步行动:
数字是杂乱的,但掌握描述性统计的人能让它们说出真相。
”

在MySQL数据库数据查询与数据分析中,GROUP BY与ORDER BY是使用频率极高的核心关键字。二者语法结构相似,常搭配使用,但核心功 ...
2026-09-14随着数字化治理、智慧运营、数字孪生技术的普及,数字体征成为衡量业务状态、系统运行、城市治理与企业经营健康度的核心体系。数 ...
2026-09-14 很多数据分析师沉迷于复杂的模型和算法,却忽略了数据分析的一项基础能力——描述性统计。事实上,大量商业分析问题,用描述 ...
2026-09-14在MySQL数据库运维与开发实践中,经常出现一种典型现象:数据库实际存储的数据量很小,数据表条数少、文件体积低,但服务器整体 ...
2026-09-11 很多数据分析师能熟练计算均值、标准差,但当被问到“总体和样本有什么区别”“参数和统计量有什么关系”“数据级别的高低如 ...
2026-09-11CDA数据分析师 出品 作者:李诗怡 定义: 将同一时间段内因具备相同属性或共同经历的用户划分为群体,分析其留存与生命周期价值 ...
2026-09-11在零售、商超、餐饮、线下门店等实体商业运营中,客流与销售额是衡量门店经营状态的两大核心指标。销售额是门店经营的最终结果, ...
2026-09-10在数据可视化体系中,柱形图是最基础、应用最广泛的图表类型,其中**累计柱形图(堆积柱状图)**是兼顾整体总量与内部结构的核心 ...
2026-09-10 许多数据分析师精通Excel函数和SQL查询,但当面对一张上万行的销售明细表,要快速回答“哪个地区销量最高”“哪款产品增长最 ...
2026-09-10在Python Pandas数据分析中,DataFrame是承载结构化数据的核心载体,数据清洗、数据修正、条件赋值、字段更新等实操场景,都离不 ...
2026-09-09 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-09-09卡方检验(Chi-Square Test)是统计学中针对分类数据的经典显著性检验方法,核心用于判断两个离散分类变量是否相互独立、数据实 ...
2026-09-09CDA数据分析师 出品 作者:李诗怡 1. 销售漏斗阶段判断 题目:销售漏斗模型中,通过广告、社交媒体等方式触达品牌信息(如浏览品 ...
2026-09-07在Python数据分析中,Pandas库的DataFrame是最核心、最常用的结构化数据表对象,类似于Excel的二维表格,具备规整的行列结构、字 ...
2026-09-07在数据分析、经营复盘、业绩预测与经济统计工作中,平均增速(平均增长率)是衡量数据长期变化趋势、业务发展快慢的核心指标。不 ...
2026-09-07 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-09-07随着大数据技术的快速发展,商业竞争逐步从传统的经验式经营转变为数据驱动的精细化运营。海量的用户行为数据、交易数据、运营数 ...
2026-09-04CDA数据分析师 出品 作者:李诗怡 1. 波士顿矩阵(BCG Matrix) 定义: BCG于1970年提出的业务组合分析工具,以"市场增长率"(纵 ...
2026-09-04 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-09-04数据透视表是Excel与Power BI中最核心的数据分析工具,具备快速汇总、维度拆分、动态筛选的能力,可高效完成数据归类与统计展示 ...
2026-09-03