SPSS分析技术：简单对应分析-CDA数据分析师官网

热线电话：13121318867

SPSS分析技术：简单对应分析

2017-07-12

SPSS分析技术：简单对应分析

分类型数据（包括定类数据和定序数据）在数据分析中扮演着重要的角色，例如，分类型数据能够帮助我们对每个数据记录进行分门别类，但是由于分类型数据的特点，很多基于均值、方差和标准差的分析方法就不太适用了，通常使用的分析方法是基于频数的卡方检验和逻辑回归等。面对变量个数少、分类类别少的简单局面，卡方检验和二分类逻辑回归还能够从容应对，一旦变量数量和变量类别多时，分析结果的解读就让人头痛了。

例如，研究全国34个省级行政区居民的收入水平情况，通过抽样收集数据，使用卡方检验能够很容易得出不同省级行政区居民的收入水平分布有显著性差异，但是无法得到北京市高收入居民比例高、云南低收入居民比例低这样具体的结果，也就是无法对分类变量各类别间的相关关系进行清楚展现。对应分析是解决类别相关关系展示很好的方法，它能够将分类交叉表转换为相应的对应分析图，从而使分类结果图形化、直观化。

对应分析原理

数据统计分析方法有个很有趣的特点，就是名字很多，经常出现同一个分析方法在不同书籍中的名称不同，真有点百家争鸣的味道，这是因为由人组成的社会，人们总是希望自己能够青史留名，这不足为奇。对应分析在很多地方也被称为同质性分析或数量化方法。

对应分析的实质就是将交叉表里面的频数数据作变换以后，展现在散点图上，从而将抽象的交叉表信息形象化。这个变换过程涉及到线性代数的内容，因此在这里就不做数学公式的推导了，草堂君在这里做个形象的解释。

我们以两个分类变量的情况来介绍对应分析的原理。学习过卡方检验的朋友应该知道，卡方检验的实质是将实际的频数分析与期望频数作对比，如果差距很大，超过界限值，那么就可以认为组成交叉表的两个分类变量之间具有相关性。举个生活例子，某汽车生产企业的市场部收集了某款汽车的销售数据，制成频数交叉表：如果年龄变量与选购的汽车颜色之间没有相关关系，那么这些频数应该是相似的，没有巨大差异，反之，如果这两个分类变量间有相关关系，那么某个或某些单元格里的频数将显著大于其它单元格。

根据上表的数据，可以制作出由期望频数组成的交叉表，期望频数的计算公式为行频数和*列频数和/总频数（参考第一列的计算过程）。卡方检验就是将上表的实际频数与下表的期望频数做逐个对比，算出卡方值和检验概率，从而判断两个变量是否有显著性差异。

对应分析承接上面两个表格的工作，它首先算出每个单元格的标准化残差，计算公式为：

从上面的公式来看，标准化残差包含了某个年龄段和某种汽车颜色的相关关系信息，相当于相关系数。说到这里，是否想到因子分析。是的，对应分析进行到这里，下一步也是提取标准化残差矩阵（交叉表）的公因子，然后将3个年龄群体和4个汽车颜色放入由公因子（新维度）组成的坐标空间内，通过它们之间的空间距离判断相关性强弱。

案例分析

欧洲人的眼睛和头发颜色可以用“绚烂多彩”来形容，特别是北欧和东欧人。欧洲人头发的颜色不仅有黑色，还有棕色、亚麻色、金黄色和红色；眼睛的颜色有棕色、蓝色、灰色、褐色和绿色。在基因理论和技术没有发展起来以前，欧洲人的眼睛颜色和头发颜色的关系一直是研究的热点，眼睛颜色和头发颜色到低是随机搭配的呢？还是眼睛的某种颜色更多和某种头发颜色搭配？对应分析方法在这个问题上的研究一直被奉为经典案例。基因技术发展起来以后，从基因的层面验证了上述对应分析的结果。