
R语言统计与分布的相关知识
变量
变量按变量值是否连续可分为连续变量与离散变量两种。 连续变量(continuous variable)与离散变量(discrete variable)
连续变量
在一定区间内可以任意取值的变量叫连续变量,其数值是连续不断的,相邻两个数值可作无限分割,即可取无限个数值。
离散变量
离散变量是指其数值只能用自然数或整数单位计算的则为离散变量.例如,企业个数,职工人数,设备台数等,只能按计量单位数计数,这种变量的数值一般用计数方法取得.
在R语言中的Data.Frame中的每一列可以表示一个变量;
变量关注点:1取值,2概率
得到了变量的取值及概率就获得了数据的分布
数据分布
数据分布的特征
集中趋势(位置)
离中趋势(分散程度)
偏态和峰态(形态)
一、集中趋势的度量
分类数据:众数
顺序数据:众数、中位数、分位数
数值型数据:众数、中位数、分位数、平均数
概念:
o
中位数(median):排序后处于中间位置上的值。如有5个数,排序后第3个数为中位数,如果为6个数,则对中间两个数求平均结果为中位数。M e四分位数(quartile): 排序后处于25%和75%位置上的值。
平均数(mean): 也称为期望
简单算数平均:
加权平均:
几何平均:
几何平均主要用于计算平均增长率;
特点:
1. 众数
不受极端值影响
具有不惟一性
数据分布偏斜程度较大时应用
2. 中位数
不受极端值影响
数据分布偏斜程度较大时应用
3. 平均数
易受极端值影响
数学性质优良
数据对称分布或接近对称分布时应用
关系:
均值在中位数左边为左偏,均值在中位数右边为右偏。
二、离散程度的度量
反映各变量值远离其中心值的程度(离散程度)
分类数据:异众比率
顺序数据:四分位差
相对位置的度量:标准分数
相对离散程度:离散系数
概念:
异众比率(variation ratio): 非众数组的频数占总频数的比例。
例子:
四分位差(quartile deviation):上四分位数与下四分位数之差。反应了中间50%数据的离散程度。
例子:
极差(range):数据中最大值与最小值之差。
方差(variance): 是各个数据分别与其平均数之差的平方的和的平均数; 反映了各变量值与均值的平均差异.
E{x}表示平均数
样本方差:
在统计学中样本的均差多是除以自由度(n-1),它是意思是样本能自由选择的程度。当选到只剩一个时,它不可能再有自由了,所以自由度是n-1。
标准差(standard deviation): 是各个数据分别与其平均数之差的平方的和的平均数的平方根;反映了各变量值与均值的平均差异. 反应了数据集的离散程度.
对方差进行开方
标准分数(standard score):也叫z分数(z-score) 是一个分数与平均数的差再除以标准差的过程。用公式表示为z=(x-μ)/σ。其中x为某一具体分数,分数即为值。
例子:
离散系数:又称为变异系数,常用的是标准差系数,用CV(Coefficient of Variance)表示。标准差与均值的比率。 用公式表示为:CV=σ/μ
离散系数反映单位均值上的离散程度,常用在两个总体均值不等的离散程度的比较上。若两个总体的均值相等,则比较标准差系数与比较标准差是等价的。在对比情况下,离散系数较大的其分布情况差异也大。
协方差:在概率论和统计学中,协方差用于衡量两个变量的总体误差。而方差是协方差的一种特殊情况,即当两个变量是相同的情况。
期望值分别为E[X]与E[Y]的两个实随机变量X与Y之间的协方差Cov(X,Y)定义为:
从直观上来看,协方差表示的是两个变量总体误差的期望。
如果两个变量的变化趋势一致,也就是说如果其中一个大于自身的期望值时另外一个也大于自身的期望值,那么两个变量之间的协方差就是正值;
如果两个变量的变化趋势相反,即其中一个变量大于自身的期望值时另外一个却小于自身的期望值,那么两个变量之间的协方差就是负值。
结果值范围为-∞~+∞,不同协方差之间是不能比较的
相关系数:
分布
离散变量的分布
1.两点分布 又称为伯努利分布
P(n) = p n (1-p) 1-n (n=1,或 n=0) 1表示成功,0表示失败
成功的概率为p,失败的概率为1-p;
2.二项分布 Binomial Distribution
即重复n次的伯努利试验(Bernoulli Experiment),用X表示随机试验的结果。
如果事件发生的概率是p,则不发生的概率q=1-p,N次独立重复试验中发生K次的概率是:
其中组合的计算公式为:
期望E(X)=np
方差D(X)=npq
例子:张三参加雅思考试,每次通过的概率假设为1/3,不通过的概率为2/3。如果他连续参加4次考试,那么恰好通过2次的概率是多少?
p=1/3, n=4, k=2 代入公式:结果为8/27
3.泊松分布 Poisson
泊松分布适用于描述单位时间内随机事件发生的次数。
泊松分布的概率函数:
期望和方差都为:λ
λ是单位时间内随机事件的平均发生率,k是指事件发生的次数。
当二项分布的n很大而p很小时,泊松分布可作为二项分布的近似,其中λ为np。通常当n≧10,p≦0.1时,二项分布就可以用泊松公式近似得计算。
在实际事例中,当一个随机事件,例如某电话交换台收到的呼叫、来到某公共汽车站的乘客、某放射性物质发射出的粒子、显微镜下某区域中的白血球等等,以固定的平均瞬时速率λ(或称密度)随机且独立地出现时,那么这个事件在单位时间(面积或体积)内出现的次数或个数就近似地服从泊松分布P(λ)。因此,泊松分布在管理科学、运筹学以及自然科学的某些问题中都占有重要的地位。
观察事物平均发生m次的条件下,实际发生x次的概率P(x)可用下式表示:
P(x)=m x *e -m /x!
例子:假设在一个公共汽车站上有许多不同线路的公交车,平均每5分钟会来2辆公交车。求5分钟内来5辆公交车的概率有多大。
k=5, λ=2 代入公式:
P(X=k=5)= 2 5 *2.71828 -2 /5*4*3*2*1 = 0.361
例子:已知某家小杂货店,平均每周售出4个水果罐头。请问该店水果罐头的每周最佳库存量是多少?
库存量越多浪费空间及金钱,库存量过少,无法满足用户的需求,减少销售量。
这里通过 累计概率 来计算,
P(X=k=0) 没有库存的概率
P(X=k=1) 库存为1的概率
P(X=k=2) 库存为2的概率
...
计算到k=7时,将这些概率进行相加,结果为92.98%,如果库存为7,说明有7.02%的概率会供不应求。这个k值根据实际应用场景进行调整。
连续变量的分布
1.均匀分布
2.指数分布
3.正态分布 Normal distribution 也叫高��分布(Gaussian distribution)
若随机变量X服从一个位置参数为μ、尺度参数为σ 的概率分布,且其概率密度函数为
μ是均值,σ 是标准差
则这个随机变量就称为正态随机变量,正态随机变量服从的分布就称为正态分布,记作X~N(μ,σ 2 ), 读作X服从正态分布。
期望E(X)=μ
方差D(X)=σ 2
期望E(X)=0
方差D(X)=1
μ变大,函数图像中轴向右移动
μ变小,函数图像中轴向左移动
σ变大,函数图像坡度变平缓
σ变小,函数图像坡度变陡
经验法则:
正态分布距离均值的左右各一个标准差的概率分布为68%,距离左右两边各两个标准差的概率分布为95%,三个标准差的概率分布式99.7%;
中心极限定理 central limit theorem:
在样本数据中随机抽取一部分数据,这部分数据的分布渐近与正态分布
概率密度函数PDF probability density function ;是一个描述这个随机变量的输出值,在某个确定的取值点附近的可能性的函数。
正态分布的概率密度函数
累计密度函数CDF cumulative distribution function; 是概率密度函数的积分。f(x)当x=k,表示小于k值的所有概率之和。单调递增曲线,无线接近于1.
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
剖析 CDA 数据分析师考试题型:解锁高效备考与答题策略 CDA(Certified Data Analyst)数据分析师考试作为衡量数据专业能力的 ...
2025-07-04SQL Server 字符串截取转日期:解锁数据处理的关键技能 在数据处理与分析工作中,数据格式的规范性是保证后续分析准确性的基础 ...
2025-07-04CDA 数据分析师视角:从数据迷雾中探寻商业真相 在数字化浪潮席卷全球的今天,数据已成为企业决策的核心驱动力,CDA(Certifie ...
2025-07-04CDA 数据分析师:开启数据职业发展新征程 在数据成为核心生产要素的今天,数据分析师的职业价值愈发凸显。CDA(Certified D ...
2025-07-03从招聘要求看数据分析师的能力素养与职业发展 在数字化浪潮席卷全球的当下,数据已成为企业的核心资产,数据分析师岗位也随 ...
2025-07-03Power BI 中如何控制过滤器选择项目数并在超限时报错 引言 在使用 Power BI 进行数据可视化和分析的过程中,对过滤器的有 ...
2025-07-03把握 CDA 考试时间,开启数据分析职业之路 在数字化转型的时代浪潮下,数据已成为企业决策的核心驱动力。CDA(Certified Da ...
2025-07-02CDA 证书:银行招聘中的 “黄金通行证” 在金融科技飞速发展的当下,银行正加速向数字化、智能化转型,海量数据成为银行精准 ...
2025-07-02探索最优回归方程:数据背后的精准预测密码 在数据分析和统计学的广阔领域中,回归分析是揭示变量之间关系的重要工具,而回 ...
2025-07-02CDA 数据分析师报考条件全解析:开启数据洞察之旅 在当今数字化浪潮席卷全球的时代,数据已成为企业乃至整个社会发展的核心驱 ...
2025-07-01深入解析 SQL 中 CASE 语句条件的执行顺序 在 SQL 编程领域,CASE语句是实现条件逻辑判断、数据转换与分类的重要工 ...
2025-07-01SPSS 中计算三个变量交集的详细指南 在数据分析领域,挖掘变量之间的潜在关系是获取有价值信息的关键步骤。当我们需要探究 ...
2025-07-01CDA 数据分析师:就业前景广阔的新兴职业 在当今数字化时代,数据已成为企业和组织决策的重要依据。数据分析师作为负责收集 ...
2025-06-30探秘卷积层:为何一个卷积层需要两个卷积核 在深度学习的世界里,卷积神经网络(CNN)凭借其强大的特征提取能力 ...
2025-06-30探索 CDA 数据分析师在线课程:开启数据洞察之旅 在数字化浪潮席卷全球的当下,数据已成为企业决策、创新与发展的核心驱 ...
2025-06-303D VLA新范式!CVPR冠军方案BridgeVLA,真机性能提升32% 编辑:LRST 【新智元导读】中科院自动化所提出BridgeVLA模型,通过将 ...
2025-06-30LSTM 为何会产生误差?深入剖析其背后的原因 在深度学习领域,LSTM(Long Short-Term Memory)网络凭借其独特的记忆单元设 ...
2025-06-27LLM进入拖拽时代!只靠Prompt几秒定制大模型,效率飙升12000倍 【新智元导读】最近,来自NUS、UT Austin等机构的研究人员创新 ...
2025-06-27探秘 z-score:数据分析中的标准化利器 在数据的海洋中,面对形态各异、尺度不同的数据,如何找到一个通用的标准来衡量数据 ...
2025-06-26Excel 中为不同柱形设置独立背景(按数据分区)的方法详解 在数据分析与可视化呈现过程中,Excel 柱形图是展示数据的常用工 ...
2025-06-26