京公网安备 11010802034615号
经营许可证编号:京B2-20210330
数据分析也要讲究打组合拳
组合拳是拳击拳法的一种,在进攻当中利用各种单一拳法的组合连续攻击,使对手顾此失彼,达到击中对手的目的。联系到数据分析过程中,引申为采取一连套的方法实现一定的目标,而每一拳就是一种分析方法。
【我们遇到这样一个问题】
美国洛杉矶 12 个地区的 5 个经济指标调查数据(总人口、学校校龄、总雇员、专业服务、中等房价),为对这 12 个地区进行综合评价, 请你出出主意,我们希望看到这12个地区中的某几个区属于同一类型,从而分而治之,有针对性的做出有意义的措施。

每个地区都有5个评价指标,不同地区的同一指标分布不同,一个地区的五个指标大小有别,差异显著,现在要对着12个地区进行评价,这是一个十分苦恼的事情。
多个评价指标,希望分而治之,聚类分析无疑是非常棒的选择,分类变量为总人口、学校校龄、总雇员、专业服务、中等房价:执行SPSS聚类过程:

12个地区最终分为几类?每个类别又有哪些特征呢?这是聚类分析需要解决的细节。我们以分为3类来说明现在遇到的新问题,树形图让我们十分清晰的看到每一次聚类的细节,哪些地区最先被归并为一类,因为他们最相似,但是,我们对着树形图又能下什么结论呢,望洋兴叹吧,树形图就是大忽悠。
不妨看看每一类别下5个评价指标的均值比较吧,这似乎有所帮助,虽然还是一片混乱,但最少我们很容易发现,第二类在每一个指标中的均值都是糟糕的,急需政府加大管理、投资的力度,第一类的地区人口不算多,但各项指标的均值都是组内最高的,可以说第一类的1、4、5、10四个地区是不用美国政府操心了,但结论是我们依然没有非常清晰的描述评价结果。
问题出在哪里?或许是用来评价地区经济情况的指标过于多了吧!
我们已经意识到一直困扰我们的其实是评价指标过多,这就需要降维,因子分析算是不错的选择,尝试是突破瓶颈的最好实践办法。接下来,我们试图将总人口、学校校龄、总雇员、专业服务、中等房价这5个指标进行降维处理,不是直接踢出,而是寻找隐匿其中潜在的因素。
因子分析 是基于相关关系而进行的数据分析技术,是一种建立在众多的观测数据的基础上的降维处理方法。其主要目的是探索隐藏在大量观测数据背后的某种结构,寻找一组变量变化的“共同因子”。
提取前两个因子,可以解释5个指标的93.4%,在没有损失太多信息的同时,获得相对良好的解释能力,这是一个稳赚不赔的卖卖。
旋转之后的载荷结果令我们十分的满意,因子1与“校龄、服务、房价”三个指标相关性极强,而这三项总是居民乐开花,地区教育水平高,多项服务,房价且不高,这是理想的居住场所,可以命名为“福利因子”,在看因子2,与“总人口、总雇员”极相关,这是“人口因子”。
5个评价指标,现在可以用2个因子来代替,此时来描述每个地区的经济情况就非常的方便了,在此基础上再“打一拳”,会有什么样的惊喜?现在,聚类分析的步骤不变,参与聚类的变量为:福利因子和人口因子。
第一类地区,首先这些地区的福利因子较好,校龄、服务项目两基础设施方面都非常完善,但是享受好福利的同时,需要更多的钱购买房子,这是富人区吧。第二类地区,人口因子、福利因子都比较差,应当受到更多关注和支持。第三类,很明显是人口众多地区,但这里的居民未公平享受到各项福利,唯一心里安慰的是房价不高吧。
到此,我们可以看出,组合拳的结果更加丰富,在不真实反映地区经济分类后,还挖潜出影响各地区排名的潜在因素,让市政决策者能够更加清晰的综合评价各地区优缺点,有的放矢。
在确定分析目标之后,数据分析过程中不妨打出组合拳,将获得更多收获,找到更本质的解决方案。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
B+树作为数据库索引的核心数据结构,其高效的查询、插入、删除性能,离不开节点间指针的合理设计。在日常学习和数据库开发中,很 ...
2026-01-30在数据库开发中,UUID(通用唯一识别码)是生成唯一主键、唯一标识的常用方式,其标准格式包含4个短横线(如550e8400-e29b-41d4- ...
2026-01-30商业数据分析的价值落地,离不开标准化、系统化的总体流程作为支撑;而CDA(Certified Data Analyst)数据分析师,作为经过系统 ...
2026-01-30在数据分析、质量控制、科研实验等场景中,数据波动性(离散程度)的精准衡量是判断数据可靠性、稳定性的核心环节。标准差(Stan ...
2026-01-29在数据分析、质量检测、科研实验等领域,判断数据间是否存在本质差异是核心需求,而t检验、F检验是实现这一目标的经典统计方法。 ...
2026-01-29统计制图(数据可视化)是数据分析的核心呈现载体,它将抽象的数据转化为直观的图表、图形,让数据规律、业务差异与潜在问题一目 ...
2026-01-29箱线图(Box Plot)作为数据分布可视化的核心工具,能清晰呈现数据的中位数、四分位数、异常值等关键统计特征,广泛应用于数据分 ...
2026-01-28在回归分析、机器学习建模等数据分析场景中,多重共线性是高频数据问题——当多个自变量间存在较强的线性关联时,会导致模型系数 ...
2026-01-28数据分析的价值落地,离不开科学方法的支撑。六种核心分析方法——描述性分析、诊断性分析、预测性分析、规范性分析、对比分析、 ...
2026-01-28在机器学习与数据分析领域,特征是连接数据与模型的核心载体,而特征重要性分析则是挖掘数据价值、优化模型性能、赋能业务决策的 ...
2026-01-27关联分析是数据挖掘领域中挖掘数据间潜在关联关系的经典方法,广泛应用于零售购物篮分析、电商推荐、用户行为路径挖掘等场景。而 ...
2026-01-27数据分析的基础范式,是支撑数据工作从“零散操作”走向“标准化落地”的核心方法论框架,它定义了数据分析的核心逻辑、流程与目 ...
2026-01-27在数据分析、后端开发、业务运维等工作中,SQL语句是操作数据库的核心工具。面对复杂的表结构、多表关联逻辑及灵活的查询需求, ...
2026-01-26支持向量机(SVM)作为机器学习中经典的分类算法,凭借其在小样本、高维数据场景下的优异泛化能力,被广泛应用于图像识别、文本 ...
2026-01-26在数字化浪潮下,数据分析已成为企业决策的核心支撑,而CDA数据分析师作为标准化、专业化的数据人才代表,正逐步成为连接数据资 ...
2026-01-26数据分析的核心价值在于用数据驱动决策,而指标作为数据的“载体”,其选取的合理性直接决定分析结果的有效性。选对指标能精准定 ...
2026-01-23在MySQL查询编写中,我们习惯按“SELECT → FROM → WHERE → ORDER BY”的语法顺序组织语句,直觉上认为代码顺序即执行顺序。但 ...
2026-01-23数字化转型已从企业“可选项”升级为“必答题”,其核心本质是通过数据驱动业务重构、流程优化与模式创新,实现从传统运营向智能 ...
2026-01-23CDA持证人已遍布在世界范围各行各业,包括世界500强企业、顶尖科技独角兽、大型金融机构、国企事业单位、国家行政机关等等,“CDA数据分析师”人才队伍遵守着CDA职业道德准则,发挥着专业技能,已成为支撑科技发展的核心力量。 ...
2026-01-22在数字化时代,企业积累的海量数据如同散落的珍珠,而数据模型就是串联这些珍珠的线——它并非简单的数据集合,而是对现实业务场 ...
2026-01-22