
SPSS带你玩转GLM方差分析,一学就会
方差分析(Analysis of Variance,简称ANOVA),又称“变异数分析”或“F检验”,是R.A.Fisher发明的,用于两个及两个以上样本均数差别的显著性检验。它是以F值为统计量的计量资料的假设检验方法。检验方法是将总方差分解成两个或多个部分方差和,推断两组或多组的总体无数是否相等。原假设H0:多个试验组的总体均数相等,即处理因素无作用。检验水准:ɑ=0.05。
GLM(一般线性模型)一般用于完全随机设计资料的方差分析(单因素方差分析)、随机区组设计资料的方差分析(两因素方差分析)、拉丁方设计资料的方差分析、交叉设计的方差分析、析因设计的方差分析、协方差分析和重复测量的方差分析。
SPSS方差分析模块——General Linear Model
Univariate:单变量方差分析——单结局指标(y),适用多种试验设计的分析
Multivariate:多变量方差分析——多结局指标(y1,y2…yk)
Repeated:重复测量方差分析
注意单因素方差分析是1个y,1个x(三分类以上),而单变量方差分析是1个y,1个或多个x,多变量方差分析是多个y,1个或多个x。单变量方差分析包含单因素方差分析(one-way ANOVA)。
1完全随机设计资料的方差分析
完全随机设计资料的方差分析是将同质的受试对象随机地分配到各处理组,再观察其试验效应。各组样本量可以相等或不等。通过考察单因素或单变量结果一致性,获得一个因素的多个不同水平之间的关系,它也是t检验的扩展。适用条件是样本为独立随机样本,服从正态分布,各组方差齐同,单个因变量为连续变量等。
案例:
研究:3组不同药物处理(A药,B药与安慰剂),观察对糖化血红蛋白的影响。
方法:为了研究三组糖化血红蛋白水平的差异,采用one way ANOVA分析,也可以采用Univariate分析。
One-way ANOVA检验结果
Univariate分析:
SPSS操作:Analyze » General linear model » Univariate
其中,固定因子(fixed factor)是指该因子在样本中所有可能的水平都出现了,即该因子的所有水平均列出了,无需外推。随机因子(random factor)是指该因子的所有可能的水平在样本中没有都出现,需要进行外推。可见固定因子和随机因子是由试验设计决定的,所以我们可以根据试验设计的不同,将同一因素视为固定因子或随机因子均可。
在试验的设计中,协变量是一个独立变量(解释变量),不为试验者所操纵,但仍影响实验结果。在心理学、行为科学中,是指与因变量有线性相关并在探讨自变量与因变量关系时通过统计技术加以控制的变量。常用的协变量包括因变量的前测分数、人口统计学指标以及与因变量明显不同的个人特征等。
Univariate分析结果
Univariate分析结果与one way ANOVA结果完全一致!
2随机区组设计资料的方差分析
随机区组设计(randomized block design),是将受试对象按性质(如动物的性别、体重,病人的病情、性别、年龄等非试验因素)相同或相近组成b个区组,每个区组中的k个受试对象分别随机分配到k个处理组中去;区组间差别越大越好,区组内差别越小越好。随机区组设计的作用是进一步控制个体差异,检验效能高于完全随机设计的方差分析。
1.单独效应(simple effect):其他因素的水平固定时,同一因素不同水平间的差别。
2.主效应(main effect):因子不同水平设置对响应造成的差异(这时不考虑其他因子的水平设置)。
3.交互作用(interaction) :一个因子在另一个因子的不同水平下的主效应是否有差异。理解为条件主效应的差异。
案例:
原案例(完全随机对照)中,考虑各处理组(A药,B药与安慰剂)对结局(糖化血红蛋白)的影响,但糖尿病病程可能是对患者结局影响的重要混杂因素。我们可以在事先设计中,将糖尿病病程相近的36个人分成12个区组,再将每个区组的3个人随机分入3组(随机区组设计)。
随机区组设计的分析方法
One-way ANOVA只能独立分析各处理组对结局(糖化血红蛋白)的影响,无法同时分析组别(试验因素)和病程(控制因素)对结局的影响。此时应该采用Univariate分析。
Univariate分析设置:Model
对话框中选择custom(自定义模型),Main effects(主效应),TypeⅢ(常见平方和类型)。DMDuration*group为交互效应,如果没有交互一般不选择这项。
Univariate分析设置:Contrasts
Contrast选择Polynomial(多项式模型趋势检验)。
Univariate分析设置: Post Hoc
Univariate结果解读
主体间效应的检验
各组间糖化血红蛋白水平,以及各病程间糖化血红蛋白水平,以及病程对分组的交互影响不明显。
期望均方表
类似方差分析表因素变异和残差
两个模型中,假定值均相同都等于0,故参照估计值和差值相等;参照估计值和差值在线性和二次模型中均p>0.05,表明均不服从模型;按α=0.05检验水准,各组糖化不呈线性和二次模型趋势。
两两比较,同样无显著性差异。
3析因设计资料的方差分析
普通分组设计:A药与B药对比,或三组:A药, B药,安慰剂;析因设计:A药与安慰剂;B药与安慰剂。普通分组重点考察两类药物本身的对比。而析因则相对独立成组,能比较A药与安慰剂,B药与安慰剂,但一般并不比较A药与B药间差异。析因能分析A与B的交互,普通分组则不可以。
析因设计(factorial)
研究目的:观察两类药物对疾病的影响
Univariate分析设置
Univariate分析设置:Plots
Univariate分析设置:Model(参阅前文)
Univariate分析设置:Options
Univariate分析设置:contrasts(参阅前文)
Univariate分析设置: Post Hoc(参阅前文)
Univariate结果解读
各处理组间,以及drug2对糖化血红蛋白水平均无显著性影响。
凡涉及存在交互效应,或不同效应因素(随机效应,或协变量存在),都建议采用GLM方法,而并不建议用one-way ANOVA。完全随机对照可以使用one-way ANOVA,但随机区组设计和析因研究则要采用univariate方法分析。
4协方差分析
为了提高试验的精确性和准确性,对处理以外的一切条件都需要采取有效措施严加控制,使它们在各处理间尽量一致,比如随机区组设计。并且试验设计也有可能疏忽,限于试验条件的限制,因素无法掌控等,就要采用协方差分析。它是试验控制的一种辅助手段。经这种矫正,试验误差将减小,对试验处理效应估计更为准确。
1、回归:建立应变量Y随协变量X变化的线性回归关系,并利用这种回归关系把X值化为相等后再进行各组Y的修正;
实质:从Y中扣除或均衡这些不可控的协变量因素的影响后,再比较多组均数间的差别。
协方差分析应用时要注意各组协变量X与因变量Y的关系是线性的,各组回归直线平行。
推荐学习书籍
《CDA一级教材》适合CDA一级考生备考,也适合业务及数据分析岗位的从业者提升自我。完整电子版已上线CDA网校,累计已有10万+在读~
免费加入阅读:https://edu.cda.cn/goods/show/3151?targetId=5147&preview=0
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在实际业务数据分析中,我们遇到的大多数数据并非理想的正态分布 —— 电商平台的用户消费金额(少数用户单次消费上万元,多数集 ...
2025-10-20在数字化交互中,用户的每一次操作 —— 从电商平台的 “浏览商品→加入购物车→查看评价→放弃下单”,到内容 APP 的 “点击短 ...
2025-10-20在数据分析的全流程中,“数据采集” 是最基础也最关键的环节 —— 如同烹饪前需备好新鲜食材,若采集的数据不完整、不准确或不 ...
2025-10-20在数据成为新时代“石油”的今天,几乎每个职场人都在焦虑: “为什么别人能用数据驱动决策、升职加薪,而我面对Excel表格却无从 ...
2025-10-18数据清洗是 “数据价值挖掘的前置关卡”—— 其核心目标是 “去除噪声、修正错误、规范格式”,但前提是不破坏数据的真实业务含 ...
2025-10-17在数据汇总分析中,透视表凭借灵活的字段重组能力成为核心工具,但原始透视表仅能呈现数值结果,缺乏对数据背景、异常原因或业务 ...
2025-10-17在企业管理中,“凭经验定策略” 的传统模式正逐渐失效 —— 金融机构靠 “研究员主观判断” 选股可能错失收益,电商靠 “运营拍 ...
2025-10-17在数据库日常操作中,INSERT INTO SELECT是实现 “批量数据迁移” 的核心 SQL 语句 —— 它能直接将一个表(或查询结果集)的数 ...
2025-10-16在机器学习建模中,“参数” 是决定模型效果的关键变量 —— 无论是线性回归的系数、随机森林的树深度,还是神经网络的权重,这 ...
2025-10-16在数字化浪潮中,“数据” 已从 “辅助决策的工具” 升级为 “驱动业务的核心资产”—— 电商平台靠用户行为数据优化推荐算法, ...
2025-10-16在大模型从实验室走向生产环境的过程中,“稳定性” 是决定其能否实用的关键 —— 一个在单轮测试中表现优异的模型,若在高并发 ...
2025-10-15在机器学习入门领域,“鸢尾花数据集(Iris Dataset)” 是理解 “特征值” 与 “目标值” 的最佳案例 —— 它结构清晰、维度适 ...
2025-10-15在数据驱动的业务场景中,零散的指标(如 “GMV”“复购率”)就像 “散落的零件”,无法支撑系统性决策;而科学的指标体系,则 ...
2025-10-15在神经网络模型设计中,“隐藏层层数” 是决定模型能力与效率的核心参数之一 —— 层数过少,模型可能 “欠拟合”(无法捕捉数据 ...
2025-10-14在数字化浪潮中,数据分析师已成为企业 “从数据中挖掘价值” 的核心角色 —— 他们既要能从海量数据中提取有效信息,又要能将分 ...
2025-10-14在企业数据驱动的实践中,“指标混乱” 是最常见的痛点:运营部门说 “复购率 15%”,产品部门说 “复购率 8%”,实则是两者对 ...
2025-10-14在手游行业,“次日留存率” 是衡量一款游戏生死的 “第一道关卡”—— 它不仅反映了玩家对游戏的初始接受度,更直接决定了后续 ...
2025-10-13分库分表,为何而生? 在信息技术发展的早期阶段,数据量相对较小,业务逻辑也较为简单,单库单表的数据库架构就能够满足大多数 ...
2025-10-13在企业数字化转型过程中,“数据孤岛” 是普遍面临的痛点:用户数据散落在 APP 日志、注册系统、客服记录中,订单数据分散在交易 ...
2025-10-13在数字化时代,用户的每一次行为 —— 从电商平台的 “浏览→加购→购买”,到视频 APP 的 “打开→搜索→观看→收藏”,再到银 ...
2025-10-11