京公网安备 11010802034615号
经营许可证编号:京B2-20210330
【R语言】单一样本推断问题
非参数统计概念:
在实际问题中,对数据的分布形式和统计模型难以作出比较明确的假定,最多只能对总体的分布做出类似于连续性型分布或者对某点对称等一般性假定。这种不假设总体分布的具体形式,尽量从数据(样本)本身获得所需要的信息,通过估计而获得分布的结构,并逐步建立对事物的数学描述和统计建模的方法称为非参数方法。
单一样本的推断问题:
符号检验
符号检验所关心的就是通过符号“+”“-”的个数来进行统计推断
eg:假设某城市16座欲出售的楼盘均价(单位:百元 /平方米)
36 32 31 25 28 36 40 32 41 26 35 35 32 87 33 35
问:该地盘楼盘价格是否与媒体公布的3700元/平方米说法相符?
分析:
总体均值的点估计是样本均值,总体中位数的点估计是样本中位数,由于中位数的稳健性,将37理解为总体的中位数,则假设问题为:
H0:M=37 H1: M不等于37(待检验的中位数值)
假设:
S+:位于37右边的个数 S-: 位于37左边的个数
令K=min{S+,S-},且K服从p=0.5的二项分布
R代码:
##1.S-为检验统计量
sign1.test = function(x,pi,q0){
s1 = sum(x<q0) #S-的个数
s2 = sum(x>q0) #S+的个数
n = s1+s2
p1 = pbinom(s1,n,pi) ### 取检验统计量K=S-,计算 P(K<=s1)
p2 = 1-pbinom(s1-1,n,pi) ### 计算 P(K>=s1)
if(p1 < p2){ m1 = "one tail test:H1: Q > q0"
}else{
m1 = "one tail test:H1: Q < q0"
}
p.value = min(p1,p2)
m2 = "two tails test"
p.value2 = 2*p.value
list(sign.test.type = m1,p.values.of.one.test = p.value,p.value.of.two.tail.test = p.value2)
}
##以上便构建了符号检验的函数,接下来可以直接调用
data=c(36,31,25,28,36,40,32,41,26,35,35,32,87,33,35,32)##赋值
x=median(data)##获取样本中位数
sign1.test(data,0.5,37)
结果解读:
p=0.02127<0.05(显著性水平),拒绝H0,认为该地盘楼盘价格是否与媒体公布的3700元/平方米存在显著差异。
趋势检验
对于趋势分析,我们用一些数对来反映前后数据的变化。为保证数对同分布,前后两个数的间隔应该固定;为保证数对不受局部干扰,前后两个数的间隔应该较大。Cox-Staut趋势检验,是以数列中位于中间位置的数为拆分点,前后两两组成数对。
例:一个住宅小区的夜间噪音长期一直保持在30分贝。后来附近有建筑工地施工。数据是连续12天夜间在该小区所测得的噪声水平(分贝)。
30,31,33,35,31,30,68,60,65,67,66,64
请问:该建筑工地是否提高了小区的噪声水平?
建立假设:
Ho:该建筑工地没有提高小区的噪声水平
H1:该建筑工地提高了小区的噪声水平
检验统计量选取:
S=min{S+,S-}
S+:每一数对前后两值之差为正的个数
S-:每一数对前后两值之差为负的个数
R代码:
CS.test = function(x){
m = length(x)
c = if(m/2-round(m/2)==0){m/2}else{(m+1)/2} ### 此处亦可用floor(m/2)代替round(m/2)
d = if(m/2-round(m/2)==0){x[1:c]-x[(c+1):m]}else{x[1:(c-1)]-x[(c+1):m]}
n1 = length(d[which(d > 0)]) ### n1 = length(which(d > 0))
n2 = length(d[which(d < 0)])
n = n1+n2
s1 = sum(sign(d)== 1)
s2 = sum(sign(d)== -1)
if(n1 > n2){
m1 = "one tail test:H1: decreasing"
p.value = pbinom(n2,n,0.5)
}else{
m1 = "one tail test:H1: increasing"
p.value = pbinom(n1,n,0.5)
}
m2 = "two tails test"
s = min(s1,s2)
p.value2 = 2*pbinom(s,n,0.5)
if(n1==n2){p.value = 0.5;p.value2 = 1}
list(sign.test.type = m1,p.values.of.one.test = p.value,p.value.of.two.tail.test = p.value2)
}
上述就是Cox-Staut检验的算法代码
代入数据:
x=c(30,31,33,35,31,30,68,60,65,67,66,64)
结果分析:
单边检验P=0.015625<0.05(显著性水平)
故拒绝H0,认为该建筑工地提高了小区的噪声水平。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在企业数据化运营体系中,同比、环比分析是洞察业务趋势、评估运营效果的核心手段。同比(与上年同期对比)可消除季节性波动影响 ...
2025-12-19在数字化时代,用户已成为企业竞争的核心资产,而“理解用户”则是激活这一资产的关键。用户行为分析系统(User Behavior Analys ...
2025-12-19在数字化转型的深水区,企业对数据价值的挖掘不再局限于零散的分析项目,而是转向“体系化运营”——数据治理体系作为保障数据全 ...
2025-12-19在数据科学的工具箱中,析因分析(Factor Analysis, FA)、聚类分析(Clustering Analysis)与主成分分析(Principal Component ...
2025-12-18自2017年《Attention Is All You Need》一文问世以来,Transformer模型凭借自注意力机制的强大建模能力,在NLP、CV、语音等领域 ...
2025-12-18在CDA(Certified Data Analyst)数据分析师的时间序列分析工作中,常面临这样的困惑:某电商平台月度销售额增长20%,但增长是来 ...
2025-12-18在机器学习实践中,“超小数据集”(通常指样本量从几十到几百,远小于模型参数规模)是绕不开的场景——医疗领域的罕见病数据、 ...
2025-12-17数据仓库作为企业决策分析的“数据中枢”,其价值完全依赖于数据质量——若输入的是缺失、重复、不一致的“脏数据”,后续的建模 ...
2025-12-17在CDA(Certified Data Analyst)数据分析师的日常工作中,“随时间变化的数据”无处不在——零售企业的每日销售额、互联网平台 ...
2025-12-17在休闲游戏的运营体系中,次日留存率是当之无愧的“生死线”——它不仅是衡量产品核心吸引力的首个关键指标,更直接决定了后续LT ...
2025-12-16在数字化转型浪潮中,“以用户为中心”已成为企业的核心经营理念,而用户画像则是企业洞察用户、精准决策的“核心工具”。然而, ...
2025-12-16在零售行业从“流量争夺”转向“价值深耕”的演进中,塔吉特百货(Target)以两场标志性实践树立了行业标杆——2000年后的孕妇精 ...
2025-12-15在统计学领域,二项分布与卡方检验是两个高频出现的概念,二者都常用于处理离散数据,因此常被初学者混淆。但本质上,二项分布是 ...
2025-12-15在CDA(Certified Data Analyst)数据分析师的工作链路中,“标签加工”是连接原始数据与业务应用的关键环节。企业积累的用户行 ...
2025-12-15在Python开发中,HTTP请求是与外部服务交互的核心场景——调用第三方API、对接微服务、爬取数据等都离不开它。虽然requests库已 ...
2025-12-12在数据驱动决策中,“数据波动大不大”是高频问题——零售店长关心日销售额是否稳定,工厂管理者关注产品尺寸偏差是否可控,基金 ...
2025-12-12在CDA(Certified Data Analyst)数据分析师的能力矩阵中,数据查询语言(SQL)是贯穿工作全流程的“核心工具”。无论是从数据库 ...
2025-12-12很多小伙伴都在问CDA考试的问题,以下是结合 2025 年最新政策与行业动态更新的 CDA 数据分析师认证考试 Q&A,覆盖考试内容、报考 ...
2025-12-11在Excel数据可视化中,柱形图因直观展示数据差异的优势被广泛使用,而背景色设置绝非简单的“换颜色”——合理的背景色能突出核 ...
2025-12-11在科研实验、商业分析或医学研究中,我们常需要判断“两组数据的差异是真实存在,还是偶然波动”——比如“新降压药的效果是否优 ...
2025-12-11