京公网安备 11010802034615号
经营许可证编号:京B2-20210330
SPSS带你玩转GLM方差分析,一学就会
方差分析(Analysis of Variance,简称ANOVA),又称“变异数分析”或“F检验”,是R.A.Fisher发明的,用于两个及两个以上样本均数差别的显著性检验。它是以F值为统计量的计量资料的假设检验方法。检验方法是将总方差分解成两个或多个部分方差和,推断两组或多组的总体无数是否相等。原假设H0:多个试验组的总体均数相等,即处理因素无作用。检验水准:ɑ=0.05。
GLM(一般线性模型)一般用于完全随机设计资料的方差分析(单因素方差分析)、随机区组设计资料的方差分析(两因素方差分析)、拉丁方设计资料的方差分析、交叉设计的方差分析、析因设计的方差分析、协方差分析和重复测量的方差分析。
SPSS方差分析模块——General Linear Model
Univariate:单变量方差分析——单结局指标(y),适用多种试验设计的分析
Multivariate:多变量方差分析——多结局指标(y1,y2…yk)
Repeated:重复测量方差分析
注意单因素方差分析是1个y,1个x(三分类以上),而单变量方差分析是1个y,1个或多个x,多变量方差分析是多个y,1个或多个x。单变量方差分析包含单因素方差分析(one-way ANOVA)。
1完全随机设计资料的方差分析
完全随机设计资料的方差分析是将同质的受试对象随机地分配到各处理组,再观察其试验效应。各组样本量可以相等或不等。通过考察单因素或单变量结果一致性,获得一个因素的多个不同水平之间的关系,它也是t检验的扩展。适用条件是样本为独立随机样本,服从正态分布,各组方差齐同,单个因变量为连续变量等。
案例:
研究:3组不同药物处理(A药,B药与安慰剂),观察对糖化血红蛋白的影响。
方法:为了研究三组糖化血红蛋白水平的差异,采用one way ANOVA分析,也可以采用Univariate分析。
One-way ANOVA检验结果
Univariate分析:
SPSS操作:Analyze » General linear model » Univariate
其中,固定因子(fixed factor)是指该因子在样本中所有可能的水平都出现了,即该因子的所有水平均列出了,无需外推。随机因子(random factor)是指该因子的所有可能的水平在样本中没有都出现,需要进行外推。可见固定因子和随机因子是由试验设计决定的,所以我们可以根据试验设计的不同,将同一因素视为固定因子或随机因子均可。
在试验的设计中,协变量是一个独立变量(解释变量),不为试验者所操纵,但仍影响实验结果。在心理学、行为科学中,是指与因变量有线性相关并在探讨自变量与因变量关系时通过统计技术加以控制的变量。常用的协变量包括因变量的前测分数、人口统计学指标以及与因变量明显不同的个人特征等。
Univariate分析结果
Univariate分析结果与one way ANOVA结果完全一致!
2随机区组设计资料的方差分析
随机区组设计(randomized block design),是将受试对象按性质(如动物的性别、体重,病人的病情、性别、年龄等非试验因素)相同或相近组成b个区组,每个区组中的k个受试对象分别随机分配到k个处理组中去;区组间差别越大越好,区组内差别越小越好。随机区组设计的作用是进一步控制个体差异,检验效能高于完全随机设计的方差分析。
1.单独效应(simple effect):其他因素的水平固定时,同一因素不同水平间的差别。
2.主效应(main effect):因子不同水平设置对响应造成的差异(这时不考虑其他因子的水平设置)。
3.交互作用(interaction) :一个因子在另一个因子的不同水平下的主效应是否有差异。理解为条件主效应的差异。
案例:
原案例(完全随机对照)中,考虑各处理组(A药,B药与安慰剂)对结局(糖化血红蛋白)的影响,但糖尿病病程可能是对患者结局影响的重要混杂因素。我们可以在事先设计中,将糖尿病病程相近的36个人分成12个区组,再将每个区组的3个人随机分入3组(随机区组设计)。
随机区组设计的分析方法
One-way ANOVA只能独立分析各处理组对结局(糖化血红蛋白)的影响,无法同时分析组别(试验因素)和病程(控制因素)对结局的影响。此时应该采用Univariate分析。
Univariate分析设置:Model
对话框中选择custom(自定义模型),Main effects(主效应),TypeⅢ(常见平方和类型)。DMDuration*group为交互效应,如果没有交互一般不选择这项。
Univariate分析设置:Contrasts
Contrast选择Polynomial(多项式模型趋势检验)。
Univariate分析设置: Post Hoc
Univariate结果解读
主体间效应的检验
各组间糖化血红蛋白水平,以及各病程间糖化血红蛋白水平,以及病程对分组的交互影响不明显。
期望均方表
类似方差分析表因素变异和残差
两个模型中,假定值均相同都等于0,故参照估计值和差值相等;参照估计值和差值在线性和二次模型中均p>0.05,表明均不服从模型;按α=0.05检验水准,各组糖化不呈线性和二次模型趋势。
两两比较,同样无显著性差异。
3析因设计资料的方差分析
普通分组设计:A药与B药对比,或三组:A药, B药,安慰剂;析因设计:A药与安慰剂;B药与安慰剂。普通分组重点考察两类药物本身的对比。而析因则相对独立成组,能比较A药与安慰剂,B药与安慰剂,但一般并不比较A药与B药间差异。析因能分析A与B的交互,普通分组则不可以。
析因设计(factorial)
研究目的:观察两类药物对疾病的影响
Univariate分析设置
Univariate分析设置:Plots
Univariate分析设置:Model(参阅前文)
Univariate分析设置:Options
Univariate分析设置:contrasts(参阅前文)
Univariate分析设置: Post Hoc(参阅前文)
Univariate结果解读
各处理组间,以及drug2对糖化血红蛋白水平均无显著性影响。
凡涉及存在交互效应,或不同效应因素(随机效应,或协变量存在),都建议采用GLM方法,而并不建议用one-way ANOVA。完全随机对照可以使用one-way ANOVA,但随机区组设计和析因研究则要采用univariate方法分析。
4协方差分析
为了提高试验的精确性和准确性,对处理以外的一切条件都需要采取有效措施严加控制,使它们在各处理间尽量一致,比如随机区组设计。并且试验设计也有可能疏忽,限于试验条件的限制,因素无法掌控等,就要采用协方差分析。它是试验控制的一种辅助手段。经这种矫正,试验误差将减小,对试验处理效应估计更为准确。
1、回归:建立应变量Y随协变量X变化的线性回归关系,并利用这种回归关系把X值化为相等后再进行各组Y的修正;
实质:从Y中扣除或均衡这些不可控的协变量因素的影响后,再比较多组均数间的差别。
协方差分析应用时要注意各组协变量X与因变量Y的关系是线性的,各组回归直线平行。
推荐学习书籍
《CDA一级教材》适合CDA一级考生备考,也适合业务及数据分析岗位的从业者提升自我。完整电子版已上线CDA网校,累计已有10万+在读~

免费加入阅读:https://edu.cda.cn/goods/show/3151?targetId=5147&preview=0
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据科学的工具箱中,析因分析(Factor Analysis, FA)、聚类分析(Clustering Analysis)与主成分分析(Principal Component ...
2025-12-18自2017年《Attention Is All You Need》一文问世以来,Transformer模型凭借自注意力机制的强大建模能力,在NLP、CV、语音等领域 ...
2025-12-18在CDA(Certified Data Analyst)数据分析师的时间序列分析工作中,常面临这样的困惑:某电商平台月度销售额增长20%,但增长是来 ...
2025-12-18在机器学习实践中,“超小数据集”(通常指样本量从几十到几百,远小于模型参数规模)是绕不开的场景——医疗领域的罕见病数据、 ...
2025-12-17数据仓库作为企业决策分析的“数据中枢”,其价值完全依赖于数据质量——若输入的是缺失、重复、不一致的“脏数据”,后续的建模 ...
2025-12-17在CDA(Certified Data Analyst)数据分析师的日常工作中,“随时间变化的数据”无处不在——零售企业的每日销售额、互联网平台 ...
2025-12-17在休闲游戏的运营体系中,次日留存率是当之无愧的“生死线”——它不仅是衡量产品核心吸引力的首个关键指标,更直接决定了后续LT ...
2025-12-16在数字化转型浪潮中,“以用户为中心”已成为企业的核心经营理念,而用户画像则是企业洞察用户、精准决策的“核心工具”。然而, ...
2025-12-16在零售行业从“流量争夺”转向“价值深耕”的演进中,塔吉特百货(Target)以两场标志性实践树立了行业标杆——2000年后的孕妇精 ...
2025-12-15在统计学领域,二项分布与卡方检验是两个高频出现的概念,二者都常用于处理离散数据,因此常被初学者混淆。但本质上,二项分布是 ...
2025-12-15在CDA(Certified Data Analyst)数据分析师的工作链路中,“标签加工”是连接原始数据与业务应用的关键环节。企业积累的用户行 ...
2025-12-15在Python开发中,HTTP请求是与外部服务交互的核心场景——调用第三方API、对接微服务、爬取数据等都离不开它。虽然requests库已 ...
2025-12-12在数据驱动决策中,“数据波动大不大”是高频问题——零售店长关心日销售额是否稳定,工厂管理者关注产品尺寸偏差是否可控,基金 ...
2025-12-12在CDA(Certified Data Analyst)数据分析师的能力矩阵中,数据查询语言(SQL)是贯穿工作全流程的“核心工具”。无论是从数据库 ...
2025-12-12很多小伙伴都在问CDA考试的问题,以下是结合 2025 年最新政策与行业动态更新的 CDA 数据分析师认证考试 Q&A,覆盖考试内容、报考 ...
2025-12-11在Excel数据可视化中,柱形图因直观展示数据差异的优势被广泛使用,而背景色设置绝非简单的“换颜色”——合理的背景色能突出核 ...
2025-12-11在科研实验、商业分析或医学研究中,我们常需要判断“两组数据的差异是真实存在,还是偶然波动”——比如“新降压药的效果是否优 ...
2025-12-11在CDA(Certified Data Analyst)数据分析师的工作体系中,数据库就像“数据仓库的核心骨架”——所有业务数据的存储、组织与提 ...
2025-12-11在神经网络模型搭建中,“最后一层是否添加激活函数”是新手常困惑的关键问题——有人照搬中间层的ReLU激活,导致回归任务输出异 ...
2025-12-05在机器学习落地过程中,“模型准确率高但不可解释”“面对数据噪声就失效”是两大核心痛点——金融风控模型若无法解释决策依据, ...
2025-12-05