R语言统计与分布的相关知识
变量
变量按变量值是否连续可分为连续变量与离散变量两种。 连续变量(continuous variable)与离散变量(discrete variable)
连续变量
在一定区间内可以任意取值的变量叫连续变量,其数值是连续不断的,相邻两个数值可作无限分割,即可取无限个数值。
离散变量
离散变量是指其数值只能用自然数或整数单位计算的则为离散变量.例如,企业个数,职工人数,设备台数等,只能按计量单位数计数,这种变量的数值一般用计数方法取得.
在R语言中的Data.Frame中的每一列可以表示一个变量;
变量关注点:1取值,2概率
得到了变量的取值及概率就获得了数据的分布
数据分布
数据分布的特征
集中趋势(位置)
离中趋势(分散程度)
偏态和峰态(形态)
一、集中趋势的度量
分类数据:众数
顺序数据:众数、中位数、分位数
数值型数据:众数、中位数、分位数、平均数
概念:
o
中位数(median):排序后处于中间位置上的值。如有5个数,排序后第3个数为中位数,如果为6个数,则对中间两个数求平均结果为中位数。M e四分位数(quartile): 排序后处于25%和75%位置上的值。
平均数(mean): 也称为期望
简单算数平均:
加权平均:
几何平均:
几何平均主要用于计算平均增长率;
特点:
1. 众数
不受极端值影响
具有不惟一性
数据分布偏斜程度较大时应用
2. 中位数
不受极端值影响
数据分布偏斜程度较大时应用
3. 平均数
易受极端值影响
数学性质优良
数据对称分布或接近对称分布时应用
关系:
均值在中位数左边为左偏,均值在中位数右边为右偏。
二、离散程度的度量
反映各变量值远离其中心值的程度(离散程度)
分类数据:异众比率
顺序数据:四分位差
相对位置的度量:标准分数
相对离散程度:离散系数
概念:
异众比率(variation ratio): 非众数组的频数占总频数的比例。
例子:
四分位差(quartile deviation):上四分位数与下四分位数之差。反应了中间50%数据的离散程度。
例子:
极差(range):数据中最大值与最小值之差。
方差(variance): 是各个数据分别与其平均数之差的平方的和的平均数; 反映了各变量值与均值的平均差异.
E{x}表示平均数
样本方差:
在统计学中样本的均差多是除以自由度(n-1),它是意思是样本能自由选择的程度。当选到只剩一个时,它不可能再有自由了,所以自由度是n-1。
标准差(standard deviation): 是各个数据分别与其平均数之差的平方的和的平均数的平方根;反映了各变量值与均值的平均差异. 反应了数据集的离散程度.
对方差进行开方
标准分数(standard score):也叫z分数(z-score) 是一个分数与平均数的差再除以标准差的过程。用公式表示为z=(x-μ)/σ。其中x为某一具体分数,分数即为值。
例子:
离散系数:又称为变异系数,常用的是标准差系数,用CV(Coefficient of Variance)表示。标准差与均值的比率。 用公式表示为:CV=σ/μ
离散系数反映单位均值上的离散程度,常用在两个总体均值不等的离散程度的比较上。若两个总体的均值相等,则比较标准差系数与比较标准差是等价的。在对比情况下,离散系数较大的其分布情况差异也大。
协方差:在概率论和统计学中,协方差用于衡量两个变量的总体误差。而方差是协方差的一种特殊情况,即当两个变量是相同的情况。
期望值分别为E[X]与E[Y]的两个实随机变量X与Y之间的协方差Cov(X,Y)定义为:
从直观上来看,协方差表示的是两个变量总体误差的期望。
如果两个变量的变化趋势一致,也就是说如果其中一个大于自身的期望值时另外一个也大于自身的期望值,那么两个变量之间的协方差就是正值;
如果两个变量的变化趋势相反,即其中一个变量大于自身的期望值时另外一个却小于自身的期望值,那么两个变量之间的协方差就是负值。
结果值范围为-∞~+∞,不同协方差之间是不能比较的
相关系数:
分布
离散变量的分布
1.两点分布 又称为伯努利分布
P(n) = p n (1-p) 1-n (n=1,或 n=0) 1表示成功,0表示失败
成功的概率为p,失败的概率为1-p;
2.二项分布 Binomial Distribution
即重复n次的伯努利试验(Bernoulli Experiment),用X表示随机试验的结果。
如果事件发生的概率是p,则不发生的概率q=1-p,N次独立重复试验中发生K次的概率是:
其中组合的计算公式为:
期望E(X)=np
方差D(X)=npq
例子:张三参加雅思考试,每次通过的概率假设为1/3,不通过的概率为2/3。如果他连续参加4次考试,那么恰好通过2次的概率是多少?
p=1/3, n=4, k=2 代入公式:结果为8/27
3.泊松分布 Poisson
泊松分布适用于描述单位时间内随机事件发生的次数。
泊松分布的概率函数:
期望和方差都为:λ
λ是单位时间内随机事件的平均发生率,k是指事件发生的次数。
当二项分布的n很大而p很小时,泊松分布可作为二项分布的近似,其中λ为np。通常当n≧10,p≦0.1时,二项分布就可以用泊松公式近似得计算。
在实际事例中,当一个随机事件,例如某电话交换台收到的呼叫、来到某公共汽车站的乘客、某放射性物质发射出的粒子、显微镜下某区域中的白血球等等,以固定的平均瞬时速率λ(或称密度)随机且独立地出现时,那么这个事件在单位时间(面积或体积)内出现的次数或个数就近似地服从泊松分布P(λ)。因此,泊松分布在管理科学、运筹学以及自然科学的某些问题中都占有重要的地位。
观察事物平均发生m次的条件下,实际发生x次的概率P(x)可用下式表示:
P(x)=m x *e -m /x!
例子:假设在一个公共汽车站上有许多不同线路的公交车,平均每5分钟会来2辆公交车。求5分钟内来5辆公交车的概率有多大。
k=5, λ=2 代入公式:
P(X=k=5)= 2 5 *2.71828 -2 /5*4*3*2*1 = 0.361
例子:已知某家小杂货店,平均每周售出4个水果罐头。请问该店水果罐头的每周最佳库存量是多少?
库存量越多浪费空间及金钱,库存量过少,无法满足用户的需求,减少销售量。
这里通过 累计概率 来计算,
P(X=k=0) 没有库存的概率
P(X=k=1) 库存为1的概率
P(X=k=2) 库存为2的概率
...
计算到k=7时,将这些概率进行相加,结果为92.98%,如果库存为7,说明有7.02%的概率会供不应求。这个k值根据实际应用场景进行调整。
连续变量的分布
1.均匀分布
2.指数分布
3.正态分布 Normal distribution 也叫高��分布(Gaussian distribution)
若随机变量X服从一个位置参数为μ、尺度参数为σ 的概率分布,且其概率密度函数为
μ是均值,σ 是标准差
则这个随机变量就称为正态随机变量,正态随机变量服从的分布就称为正态分布,记作X~N(μ,σ 2 ), 读作X服从正态分布。
期望E(X)=μ
方差D(X)=σ 2
期望E(X)=0
方差D(X)=1
μ变大,函数图像中轴向右移动
μ变小,函数图像中轴向左移动
σ变大,函数图像坡度变平缓
σ变小,函数图像坡度变陡
经验法则:
正态分布距离均值的左右各一个标准差的概率分布为68%,距离左右两边各两个标准差的概率分布为95%,三个标准差的概率分布式99.7%;
中心极限定理 central limit theorem:
在样本数据中随机抽取一部分数据,这部分数据的分布渐近与正态分布
概率密度函数PDF probability density function ;是一个描述这个随机变量的输出值,在某个确定的取值点附近的可能性的函数。
正态分布的概率密度函数
累计密度函数CDF cumulative distribution function; 是概率密度函数的积分。f(x)当x=k,表示小于k值的所有概率之和。单调递增曲线,无线接近于1.
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据分析在当今信息时代发挥着重要作用。单因素方差分析(One-Way ANOVA)是一种关键的统计方法,用于比较三个或更多独立样本组 ...
2025-04-25CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-25在当今数字化时代,数据分析师的重要性与日俱增。但许多人在踏上这条职业道路时,往往充满疑惑: 如何成为一名数据分析师?成为 ...
2025-04-24以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《刘静:10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda ...
2025-04-23大咖简介: 刘凯,CDA大咖汇特邀讲师,DAMA中国分会理事,香港金管局特聘数据管理专家,拥有丰富的行业经验。本文将从数据要素 ...
2025-04-22CDA持证人简介 刘伟,美国 NAU 大学计算机信息技术硕士, CDA数据分析师三级持证人,现任职于江苏宝应农商银行数据治理岗。 学 ...
2025-04-21持证人简介:贺渲雯 ,CDA 数据分析师一级持证人,互联网行业数据分析师 今天我将为大家带来一个关于用户私域用户质量数据分析 ...
2025-04-18一、CDA持证人介绍 在数字化浪潮席卷商业领域的当下,数据分析已成为企业发展的关键驱动力。为助力大家深入了解数据分析在电商行 ...
2025-04-17CDA持证人简介:居瑜 ,CDA一级持证人,国企财务经理,13年财务管理运营经验,在数据分析实践方面积累了丰富的行业经验。 一、 ...
2025-04-16持证人简介: CDA持证人刘凌峰,CDA L1持证人,微软认证讲师(MCT)金山办公最有价值专家(KVP),工信部高级项目管理师,拥有 ...
2025-04-15持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。在实际生活中,我们可能会 ...
2025-04-14在 Python 编程学习与实践中,Anaconda 是一款极为重要的工具。它作为一个开源的 Python 发行版本,集成了众多常用的科学计算库 ...
2025-04-14随着大数据时代的深入发展,数据运营成为企业不可或缺的岗位之一。这个职位的核心是通过收集、整理和分析数据,帮助企业做出科 ...
2025-04-11持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。 本次分享我将以教培行业为 ...
2025-04-11近日《2025中国城市长租市场发展蓝皮书》(下称《蓝皮书》)正式发布。《蓝皮书》指出,当前我国城市住房正经历从“增量扩张”向 ...
2025-04-10在数字化时代的浪潮中,数据已经成为企业决策和运营的核心。每一位客户,每一次交易,都承载着丰富的信息和价值。 如何在海量客 ...
2025-04-09数据是数字化的基础。随着工业4.0的推进,企业生产运作过程中的在线数据变得更加丰富;而互联网、新零售等C端应用的丰富多彩,产 ...
2025-04-094月7日,美国关税政策对全球金融市场的冲击仍在肆虐,周一亚市早盘,美股股指、原油期货、加密货币、贵金属等资产齐齐重挫,市场 ...
2025-04-08背景 3月26日,科技圈迎来一则重磅消息,苹果公司宣布向浙江大学捐赠 3000 万元人民币,用于支持编程教育。 这一举措并非偶然, ...
2025-04-07在当今数据驱动的时代,数据分析能力备受青睐,数据分析能力频繁出现在岗位需求的描述中,不分岗位的任职要求中,会特意标出“熟 ...
2025-04-03