京公网安备 11010802034615号
经营许可证编号:京B2-20210330
小李刚入职了一家互联网公司的运营部门。第一次参加业务复盘会,运营主管问了一个看似简单的问题:“这个月新用户留存率下降了5个百分点,情况严重吗?”
小李立刻调出数据,跑了一堆报表,算出留存率的均值、中位数、标准差……数据堆了满满一页,却说不出到底“严重不严重”。
旁边一位资深分析师接过话头:“我们上个月做过A/B测试,正常波动范围在±3%以内。现在下降5%超出正常波动,且连续两周趋势向下,需要立即排查新用户引导流程。”
同样是留存率下降5%,这位分析师只用了几秒钟就判断出了问题的严重性。区别在哪里?关键在于对统计基本概念的深刻理解——什么是正常波动?什么是抽样误差?统计量如何推断总体?这些正是统计要解决的核心问题。
本文将从CDA认证的知识体系出发,系统拆解统计学的本质与基本概念,帮助你把“死记硬背”的统计知识,转化为“活学活用”的数据分析能力。
统计学是一门收集、处理、分析、解释数据,并从数据中得出结论的科学。这一定义涵盖了一个完整的分析闭环:
收集数据 → 处理数据 → 分析数据 → 解释数据 → 得出结论
”
在CDA的知识体系中,研究思路正是遵循这个闭环:
描述性统计:涉及收集、整理、总结和呈现数据的技术。它回答的是“数据长什么样”的问题。例如:平均客单价是多少?销售额的波动有多大?——这些都不需要推断,只需要对已有数据进行汇总和描述即可。
推断性统计:涉及利用样本数据推断总体特征的技术。它回答的是“从样本能得出什么总体结论”的问题。例如,对1000个用户进行了调查,能推断出全部100万用户的行为特征吗?——这就需要推断统计的方法。推断性分析包含参数估计、假设检验、列联分析等内容。
数据、总体、样本、参数、变量这些概念是统计学的基本构成元素,理解它们是掌握所有后续统计方法的前提。
总体:指根据研究目的确定的同质研究对象的全体。总体是“所有元素的集合”,其中每个元素称为个体。
例如,研究“我国男性的平均身高”这一问题时,总体应为我国所有男性。
样本:从总体中随机抽取的部分个体。例如,从我国所有男性中随机抽取1000人进行身高测量,这1000人就是样本。构成样本的元素的数目称为样本容量。
在实际工作中,我们很少能接触到完整的总体数据——用户有100万,订单有1000万条,但分析资源有限。数据分析师的工作常态是:基于样本数据,推断总体特征。
参数:指研究者想要了解的总体的某种特征值。参数通常是未知的,因为不可能观测到总体中的所有个体。常见的参数有总体均值、总体标准差、总体比例等。
统计量:指根据样本数据计算出来的一个量,即样本的某个特征值。常见的统计量有样本均值、样本标准差、样本比例等。
参数是客观存在的“事实” ,统计量是我们手中掌握的“线索”。数据分析师的任务,正是通过手中的统计量,去推断和估计未知的参数。
变量是描述个体某个特征的名称,其取值会随着个体的不同而发生变化。变量是统计研究的基本单元。
数据的计量尺度和具体的统计方法息息相关,大致分为3类:
| 计量尺度 | 变量类型 | 特征 | 典型示例 |
|---|---|---|---|
| 名义测量 | 分类变量 | 最低等级,仅区分类别,无大小、顺序关系 | 性别(1或2)、民族(1、2、3…) |
| 次序测量 | 顺序变量 | 量化水平更高,数值代表有序分类 | 受教育程度的高低(1、2、3…) |
| 连续变量测量 | 数值变量 | 量化程度最高,采用实际测量值 | 年龄、身高、销售额、温度 |
连续变量测量可进一步细分为间距测量和比例测量:
值得注意的是,分类变量、顺序变量、连续变量的量化水平是由低到高的,低水平变量的统计量可以用于高水平,但高水平变量的统计量不一定能用于低水平。
正态分布是最常见、最重要的连续型概率分布,许多自然和社会现象都近似服从正态分布(如身高、考试成绩、测量误差等)。正态分布的形态呈“钟形曲线”,对称分布在均值两侧,具有“中间高、两头低”的特点。
正态分布在数据分析中的应用极为广泛,是参数估计、假设检验等推断统计方法的重要理论基础。
两点分布(也称伯努利分布)是最简单的离散型概率分布,只有两种可能的结果(成功/失败、是/否)。例如:掷一次硬币,正面朝上的概率为p,反面朝上的概率为1-p。
你是某互联网公司的数据分析师。公司刚刚进行了一次用户满意度调查,收集了500份有效问卷。调查内容包括:用户ID、年龄、性别、城市等级(一线/新一线/二线/其他)、满意度评分(1-5分)、是否推荐给朋友(是/否)。
老板要求你回答以下问题:
第一步:明确总体与样本
第二步:识别变量类型与计量尺度
| 变量 | 计量尺度 | 变量类型 | 说明 |
|---|---|---|---|
| 用户ID | 名义测量 | 分类变量 | 仅用于标识,不能计算 |
| 年龄 | 比率测量 | 数值变量 | 有绝对零点,可比较倍数 |
| 性别 | 名义测量 | 分类变量 | 仅区分类别,无顺序 |
| 城市等级 | 次序测量 | 顺序变量 | 一线>新一线>二线>其他 |
| 满意度评分 | 间距测量 | 数值变量 | 1-5分,无绝对零点 |
| 是否推荐 | 名义测量 | 分类变量 | 是/否两类结果 |
第三步:描述性统计分析
根据CDA大纲的要求,描述性统计需从集中趋势、离散程度、分布形态三个维度进行描述:
第四步:推断统计
用样本统计量推断总体参数:
这就是一套完整的“识别变量类型 → 描述性统计 → 推断统计”的实战流程。掌握了统计基本概念,你就能从一堆数字中提炼出有价值的商业洞察。
”
很多数据分析师会算均值、标准差,但当被问到“总体和样本有什么区别”“参数和统计量有什么关系”“数据级别的排序是怎样的”时,却答不上来。
知其然还要知其所以然,这正是CDA Level I认证的价值所在。
统计基本概念模块在CDA一级考试中要求达到**〖熟知〗级别**,是考试的重点部分。从统计学的含义与应用,到总体、样本、参数、变量等核心概念,再到正态分布、两点分布等常用分布——这些知识不仅是考试的得分点,更是数据分析师日常工作的“底层语言”。
下一步行动:
数字是冰冷的,但掌握统计的人能让它们说出真相。
”

数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在零售、商超、餐饮、线下门店等实体商业运营中,客流与销售额是衡量门店经营状态的两大核心指标。销售额是门店经营的最终结果, ...
2026-09-10在数据可视化体系中,柱形图是最基础、应用最广泛的图表类型,其中**累计柱形图(堆积柱状图)**是兼顾整体总量与内部结构的核心 ...
2026-09-10 许多数据分析师精通Excel函数和SQL查询,但当面对一张上万行的销售明细表,要快速回答“哪个地区销量最高”“哪款产品增长最 ...
2026-09-10在Python Pandas数据分析中,DataFrame是承载结构化数据的核心载体,数据清洗、数据修正、条件赋值、字段更新等实操场景,都离不 ...
2026-09-09 很多数据分析师掌握了Excel函数、会写SQL查询,但当被问到“数据从哪里来”“数据加工有哪些步骤”“如何使用分析工具连接数 ...
2026-09-09卡方检验(Chi-Square Test)是统计学中针对分类数据的经典显著性检验方法,核心用于判断两个离散分类变量是否相互独立、数据实 ...
2026-09-09CDA数据分析师 出品 作者:李诗怡 1. 销售漏斗阶段判断 题目:销售漏斗模型中,通过广告、社交媒体等方式触达品牌信息(如浏览品 ...
2026-09-07在Python数据分析中,Pandas库的DataFrame是最核心、最常用的结构化数据表对象,类似于Excel的二维表格,具备规整的行列结构、字 ...
2026-09-07在数据分析、经营复盘、业绩预测与经济统计工作中,平均增速(平均增长率)是衡量数据长期变化趋势、业务发展快慢的核心指标。不 ...
2026-09-07 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-09-07随着大数据技术的快速发展,商业竞争逐步从传统的经验式经营转变为数据驱动的精细化运营。海量的用户行为数据、交易数据、运营数 ...
2026-09-04CDA数据分析师 出品 作者:李诗怡 1. 波士顿矩阵(BCG Matrix) 定义: BCG于1970年提出的业务组合分析工具,以"市场增长率"(纵 ...
2026-09-04 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-09-04数据透视表是Excel与Power BI中最核心的数据分析工具,具备快速汇总、维度拆分、动态筛选的能力,可高效完成数据归类与统计展示 ...
2026-09-03在Power BI数据分析可视化场景中,堆积柱状图+折线图是最常用的复合图表组合。堆积柱状图适合展示各细分维度当期数值、结构占比 ...
2026-09-03 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据的基本处理单位是什么”“数据类型误判会引发哪些分析错误”“ ...
2026-09-03CDA数据分析师 出品 作者:李诗怡 一、8个核心数据清洗函数 1. TRIM:一键清除多余空格(最常用) 作用:仅保留文本中"单词/字 ...
2026-09-02数据分析的核心并非单纯操作工具、整理报表或绘制图表,而是依靠科学的思维逻辑挖掘数据价值、解释业务现象、指导经营决策。在完 ...
2026-09-02在社会经济、产业研究、区域治理与大数据实证分析中,面板数据是最具研究价值的数据类型。面板数据同时包含截面维度与时间维度信 ...
2026-09-02 很多数据分析师能熟练计算均值、标准差,但当被问到“如何用一张图让业务方3秒内看懂核心结论”“面对不同数据类型该怎么选 ...
2026-09-02