
典型相关VS潜变量相关_数据分析_大数据
关于数据分析中的典型相关和潜变量相关,相信有许多人有各种各样的问题,这里谈谈一些我"数据分析师"的理解。前段时间,看到这样一个案例。案例要求衡量学生的文科成绩与理科成绩之间的相关性。文科成绩包括语文、政治、历史,理科成绩包括数学、物理和化学。那么这道题该怎么做?面对多元相关分析,你"数据分析师"可能会想到两种方法:一种是采用典型相关分析,计算这两组变量间的典型相关系数;另一种是采用结构方程中的潜变量相关,将文科和理科看成是潜变量,将语文、政治、历史看成是文科的测量变量,数学、物理、化学看成是理科的测量变量,然后计算两个潜变量间的相关系数。从理论上看貌似这两种方法都可以,但是计算的结果却可能相差甚远。
典型相关分析的基本思想是采用类似主成分分析的方法,把多变量与多变量之间的相关转化为两个变量之间相关。首先在每组变量内部找出具有最大相关性的一个线性变量组合,然后再在每组变量内找出第二对线性组合,使其本身具有最大的相关性,并分别与第一对线性组合不相关。如此下去,直到两组变量内各变量之间的相关性被提取完毕为止。有了这些最大相关的线性组合,则讨论两组变量之间的相关,就转化为研究这些线性组合的最大相关,从而减少了研究变量的个数。
结构方程中的潜变量相关,常用的计算潜变量的方法是主成份。"数据分析师"在实际计算中,如果第一主成份特别大,也就是说只有一个主成份的时候,潜变量相关系数等于第一主成份间的相关系数。如果各个显变量的提取的主成份不只一个,结果就略有不同了。
其实,典型相关分析和潜变量相关的不同在于,一个依据相关系数最大提取典型变量,一个依据方差最大提取主成分。所以这个两个计算出来的相关系数会有明显的差异。更夸张的是,有些时候这种差异会很大的!很大,明白吗?甚至一个是显著正相关(-0.5以上),一个是显著负相关(-0.5以上)。这个现象不是胡扯,我采用模拟数据时曾经确实出现过。
典型变量是各指标的线性组合,在这个线性组合中,各个变量的系数可能是正可能是否,加上提取的时候使得相关系数最大,所以典型相关分析的结果往往大于0。而"数据分析师"在计算潜变量相关时,先提取主成分,然后计算主成分之间的相关,所以这个潜变量的相关系数取值范围应该是在【-1,1】。
需要说明的是,当我们实际面临上述的问题时,可能既不采用典型相关分析,也不采用潜变量相关,而是分别计算语文+政治+历史的总分与数学+物理+化学的总分,用这两个总分代表文科和理科的成绩,直接计算这两个总分间的相关系数。因为这几个成绩在量纲、数量级上都相同,直接相加不仅具有实际意义,而且容易理解,得出的结果也能够更好地解释和反映实际问题。
最后罗嗦一句,算是对数据分析人员"数据分析师"的忠告:当我们面对一个实际问题时,不应该一味地追求分析方法的高级和复杂,而更应该力求用最简单最合适的方法解决问题。或许,悬乎的方法可以忽悠同事、忽悠领导,甚至忽悠自己,但记住市场相信真像,它绝对不会被任何人忽悠。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
PyTorch 核心机制:损失函数与反向传播如何驱动模型进化 在深度学习的世界里,模型从 “一无所知” 到 “精准预测” 的蜕变,离 ...
2025-07-252025 年 CDA 数据分析师考纲焕新,引领行业人才新标准 在数字化浪潮奔涌向前的当下,数据已成为驱动各行业发展的核心要素。作为 ...
2025-07-25从数据到决策:CDA 数据分析师如何重塑职场竞争力与行业价值 在数字经济席卷全球的今天,数据已从 “辅助工具” 升级为 “核心资 ...
2025-07-25用 Power BI 制作地图热力图:基于经纬度数据的实践指南 在数据可视化领域,地图热力图凭借直观呈现地理数据分布密度的优势,成 ...
2025-07-24解析 insert into select 是否会锁表:原理、场景与应对策略 在数据库操作中,insert into select 是一种常用的批量数据插入语句 ...
2025-07-24CDA 数据分析师的工作范围解析 在数字化时代的浪潮下,数据已成为企业发展的核心资产之一。CDA(Certified Data Analyst)数据分 ...
2025-07-24从 CDA LEVEL II 考试题型看 Python 数据分析要点 在数据科学领域蓬勃发展的当下,CDA(Certified Data Analyst)认证成为众多从 ...
2025-07-23用 Python 开启数据分析之旅:从基础到实践的完整指南 在数据驱动决策的时代,数据分析已成为各行业不可或缺的核心能力。而 Pyt ...
2025-07-23鸢尾花判别分析:机器学习中的经典实践案例 在机器学习的世界里,有一个经典的数据集如同引路明灯,为无数初学者打开了模式识别 ...
2025-07-23解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-07-22解析神经网络中 Softmax 函数的核心作用 在神经网络的发展历程中,激活函数扮演着至关重要的角色,它们为网络赋予了非线性能力, ...
2025-07-22CDA数据分析师证书考取全攻略 一、了解 CDA 数据分析师认证 CDA 数据分析师认证是一套科学化、专业化、国际化的人才考核标准, ...
2025-07-22左偏态分布转正态分布:方法、原理与实践 左偏态分布转正态分布:方法、原理与实践 在统计分析、数据建模和科学研究中,正态分 ...
2025-07-22你是不是也经常刷到别人涨粉百万、带货千万,心里痒痒的,想着“我也试试”,结果三个月过去,粉丝不到1000,播放量惨不忍睹? ...
2025-07-21我是陈辉,一个创业十多年的企业主,前半段人生和“文字”紧紧绑在一起。从广告公司文案到品牌策划,再到自己开策划机构,我靠 ...
2025-07-21CDA 数据分析师的职业生涯规划:从入门到卓越的成长之路 在数字经济蓬勃发展的当下,数据已成为企业核心竞争力的重要来源,而 CD ...
2025-07-21MySQL执行计划中rows的计算逻辑:从原理到实践 MySQL 执行计划中 rows 的计算逻辑:从原理到实践 在 MySQL 数据库的查询优化中 ...
2025-07-21在AI渗透率超85%的2025年,企业生存之战就是数据之战,CDA认证已成为决定企业存续的生死线!据麦肯锡全球研究院数据显示,AI驱 ...
2025-07-2035岁焦虑像一把高悬的利刃,裁员潮、晋升无望、技能过时……当职场中年危机与数字化浪潮正面交锋,你是否发现: 简历投了10 ...
2025-07-20CDA 数据分析师报考条件详解与准备指南 在数据驱动决策的时代浪潮下,CDA 数据分析师认证愈发受到瞩目,成为众多有志投身数 ...
2025-07-18