京公网安备 11010802034615号
经营许可证编号:京B2-20210330
SPSS带你玩转GLM方差分析,一学就会
方差分析(Analysis of Variance,简称ANOVA),又称“变异数分析”或“F检验”,是R.A.Fisher发明的,用于两个及两个以上样本均数差别的显著性检验。它是以F值为统计量的计量资料的假设检验方法。检验方法是将总方差分解成两个或多个部分方差和,推断两组或多组的总体无数是否相等。原假设H0:多个试验组的总体均数相等,即处理因素无作用。检验水准:ɑ=0.05。
GLM(一般线性模型)一般用于完全随机设计资料的方差分析(单因素方差分析)、随机区组设计资料的方差分析(两因素方差分析)、拉丁方设计资料的方差分析、交叉设计的方差分析、析因设计的方差分析、协方差分析和重复测量的方差分析。
SPSS方差分析模块——General Linear Model
Univariate:单变量方差分析——单结局指标(y),适用多种试验设计的分析
Multivariate:多变量方差分析——多结局指标(y1,y2…yk)
Repeated:重复测量方差分析
注意单因素方差分析是1个y,1个x(三分类以上),而单变量方差分析是1个y,1个或多个x,多变量方差分析是多个y,1个或多个x。单变量方差分析包含单因素方差分析(one-way ANOVA)。
1完全随机设计资料的方差分析
完全随机设计资料的方差分析是将同质的受试对象随机地分配到各处理组,再观察其试验效应。各组样本量可以相等或不等。通过考察单因素或单变量结果一致性,获得一个因素的多个不同水平之间的关系,它也是t检验的扩展。适用条件是样本为独立随机样本,服从正态分布,各组方差齐同,单个因变量为连续变量等。
案例:
研究:3组不同药物处理(A药,B药与安慰剂),观察对糖化血红蛋白的影响。
方法:为了研究三组糖化血红蛋白水平的差异,采用one way ANOVA分析,也可以采用Univariate分析。
One-way ANOVA检验结果
Univariate分析:
SPSS操作:Analyze » General linear model » Univariate
其中,固定因子(fixed factor)是指该因子在样本中所有可能的水平都出现了,即该因子的所有水平均列出了,无需外推。随机因子(random factor)是指该因子的所有可能的水平在样本中没有都出现,需要进行外推。可见固定因子和随机因子是由试验设计决定的,所以我们可以根据试验设计的不同,将同一因素视为固定因子或随机因子均可。
在试验的设计中,协变量是一个独立变量(解释变量),不为试验者所操纵,但仍影响实验结果。在心理学、行为科学中,是指与因变量有线性相关并在探讨自变量与因变量关系时通过统计技术加以控制的变量。常用的协变量包括因变量的前测分数、人口统计学指标以及与因变量明显不同的个人特征等。
Univariate分析结果
Univariate分析结果与one way ANOVA结果完全一致!
2随机区组设计资料的方差分析
随机区组设计(randomized block design),是将受试对象按性质(如动物的性别、体重,病人的病情、性别、年龄等非试验因素)相同或相近组成b个区组,每个区组中的k个受试对象分别随机分配到k个处理组中去;区组间差别越大越好,区组内差别越小越好。随机区组设计的作用是进一步控制个体差异,检验效能高于完全随机设计的方差分析。
1.单独效应(simple effect):其他因素的水平固定时,同一因素不同水平间的差别。
2.主效应(main effect):因子不同水平设置对响应造成的差异(这时不考虑其他因子的水平设置)。
3.交互作用(interaction) :一个因子在另一个因子的不同水平下的主效应是否有差异。理解为条件主效应的差异。
案例:
原案例(完全随机对照)中,考虑各处理组(A药,B药与安慰剂)对结局(糖化血红蛋白)的影响,但糖尿病病程可能是对患者结局影响的重要混杂因素。我们可以在事先设计中,将糖尿病病程相近的36个人分成12个区组,再将每个区组的3个人随机分入3组(随机区组设计)。
随机区组设计的分析方法
One-way ANOVA只能独立分析各处理组对结局(糖化血红蛋白)的影响,无法同时分析组别(试验因素)和病程(控制因素)对结局的影响。此时应该采用Univariate分析。
Univariate分析设置:Model
对话框中选择custom(自定义模型),Main effects(主效应),TypeⅢ(常见平方和类型)。DMDuration*group为交互效应,如果没有交互一般不选择这项。
Univariate分析设置:Contrasts
Contrast选择Polynomial(多项式模型趋势检验)。
Univariate分析设置: Post Hoc
Univariate结果解读
主体间效应的检验
各组间糖化血红蛋白水平,以及各病程间糖化血红蛋白水平,以及病程对分组的交互影响不明显。
期望均方表
类似方差分析表因素变异和残差
两个模型中,假定值均相同都等于0,故参照估计值和差值相等;参照估计值和差值在线性和二次模型中均p>0.05,表明均不服从模型;按α=0.05检验水准,各组糖化不呈线性和二次模型趋势。
两两比较,同样无显著性差异。
3析因设计资料的方差分析
普通分组设计:A药与B药对比,或三组:A药, B药,安慰剂;析因设计:A药与安慰剂;B药与安慰剂。普通分组重点考察两类药物本身的对比。而析因则相对独立成组,能比较A药与安慰剂,B药与安慰剂,但一般并不比较A药与B药间差异。析因能分析A与B的交互,普通分组则不可以。
析因设计(factorial)
研究目的:观察两类药物对疾病的影响
Univariate分析设置
Univariate分析设置:Plots
Univariate分析设置:Model(参阅前文)
Univariate分析设置:Options
Univariate分析设置:contrasts(参阅前文)
Univariate分析设置: Post Hoc(参阅前文)
Univariate结果解读
各处理组间,以及drug2对糖化血红蛋白水平均无显著性影响。
凡涉及存在交互效应,或不同效应因素(随机效应,或协变量存在),都建议采用GLM方法,而并不建议用one-way ANOVA。完全随机对照可以使用one-way ANOVA,但随机区组设计和析因研究则要采用univariate方法分析。
4协方差分析
为了提高试验的精确性和准确性,对处理以外的一切条件都需要采取有效措施严加控制,使它们在各处理间尽量一致,比如随机区组设计。并且试验设计也有可能疏忽,限于试验条件的限制,因素无法掌控等,就要采用协方差分析。它是试验控制的一种辅助手段。经这种矫正,试验误差将减小,对试验处理效应估计更为准确。
1、回归:建立应变量Y随协变量X变化的线性回归关系,并利用这种回归关系把X值化为相等后再进行各组Y的修正;
实质:从Y中扣除或均衡这些不可控的协变量因素的影响后,再比较多组均数间的差别。
协方差分析应用时要注意各组协变量X与因变量Y的关系是线性的,各组回归直线平行。
推荐学习书籍
《CDA一级教材》适合CDA一级考生备考,也适合业务及数据分析岗位的从业者提升自我。完整电子版已上线CDA网校,累计已有10万+在读~

免费加入阅读:https://edu.cda.cn/goods/show/3151?targetId=5147&preview=0
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据工作的全流程中,数据清洗是最基础、最耗时,同时也是最关键的核心环节,无论后续是做常规数据分析、可视化报表,还是开展 ...
2026-03-20在大数据与数据驱动决策的当下,“数据分析”与“数据挖掘”是高频出现的两个核心概念,也是很多职场人、入门学习者容易混淆的术 ...
2026-03-20在CDA(Certified Data Analyst)数据分析师的全流程工作闭环中,统计制图是连接严谨统计分析与高效业务沟通的关键纽带,更是CDA ...
2026-03-20在MySQL数据库优化中,分区表是处理海量数据的核心手段——通过将大表按分区键(如时间、地域、ID范围)分割为多个独立的小分区 ...
2026-03-19在商业智能与数据可视化领域,同比、环比增长率是分析数据变化趋势的核心指标——同比(YoY)聚焦“长期趋势”,通过当前周期与 ...
2026-03-19在数据分析与建模领域,流传着一句行业共识:“数据决定上限,特征决定下限”。对CDA(Certified Data Analyst)数据分析师而言 ...
2026-03-19机器学习算法工程的核心价值,在于将理论算法转化为可落地、可复用、高可靠的工程化解决方案,解决实际业务中的痛点问题。不同于 ...
2026-03-18在动态系统状态估计与目标跟踪领域,高精度、高鲁棒性的状态感知是机器人导航、自动驾驶、工业控制、目标检测等场景的核心需求。 ...
2026-03-18“垃圾数据进,垃圾结果出”,这是数据分析领域的黄金法则,更是CDA(Certified Data Analyst)数据分析师日常工作中时刻恪守的 ...
2026-03-18在机器学习建模中,决策树模型因其结构直观、易于理解、无需复杂数据预处理等优势,成为分类与回归任务的首选工具之一。而变量重 ...
2026-03-17在数据分析中,卡方检验是一类基于卡方分布的假设检验方法,核心用于分析分类变量之间的关联关系或实际观测分布与理论期望分布的 ...
2026-03-17在数字化转型的浪潮中,企业积累的数据日益庞大且分散——用户数据散落在注册系统、APP日志、客服记录中,订单数据分散在交易平 ...
2026-03-17在数字化时代,数据分析已成为企业决策、业务优化、增长突破的核心支撑,从数据仓库搭建(如维度表与事实表的设计)、数据采集清 ...
2026-03-16在数据仓库建设、数据分析(尤其是用户行为分析、业务指标分析)的实践中,维度表与事实表是两大核心组件,二者相互依存、缺一不 ...
2026-03-16数据是CDA(Certified Data Analyst)数据分析师开展一切工作的核心载体,而数据读取作为数据生命周期的关键环节,是连接原始数 ...
2026-03-16在用户行为分析实践中,很多从业者会陷入一个核心误区:过度关注“当前数据的分析结果”,却忽视了结果的“泛化能力”——即分析 ...
2026-03-13在数字经济时代,用户的每一次点击、浏览、停留、转化,都在传递着真实的需求信号。用户行为分析,本质上是通过收集、整理、挖掘 ...
2026-03-13在金融、零售、互联网等数据密集型行业,量化策略已成为企业挖掘商业价值、提升决策效率、控制经营风险的核心工具。而CDA(Certi ...
2026-03-13在机器学习建模体系中,随机森林作为集成学习的经典算法,凭借高精度、抗过拟合、适配多场景、可解释性强的核心优势,成为分类、 ...
2026-03-12在机器学习建模过程中,“哪些特征对预测结果影响最大?”“如何筛选核心特征、剔除冗余信息?”是从业者最常面临的核心问题。随 ...
2026-03-12