京公网安备 11010802034615号
经营许可证编号:京B2-20210330
判别分析介绍及其SPSS实现操作_数据分析师
判别分析(Discriminate Analysis)是市场研究的重要分析技术,也是多变量分析技术。判别分析是一种进行统计判别和分类的统计技术手段。它可以就一定数量的个体的一个分类变量和相应的其它多元变量的已知信息,确定分类变量与其它多元变量之间的数量关系,建立判别函数,并利用判别函数构建Biplot二元判别图(概念图)。同时,利用这一数量关系对其他已知多元变量的信息、但未知分组的子类型的个体进行判别分组。
判别分析属于监督类分析方法,例如:市场细分研究中,常涉及判别个体所属类型的问题,也常涉及不同品牌在一组产品属性之间的消费者偏好和认知概念,判别分析可以很好地对这种差异进行鉴别。并在低维度空间表现这种差异。
一般来讲,利用判别分析首先要明确变量测量尺度及变量的类型和关系;
因变量(dependent variable): 分组变量——定性数据(个体、产品/品牌、特征,定类变量)。
自变量 (independent variable):判别变量——定量数据(属性的评价得分,数量型变量)。
明确因变量后:我们需要明确我们分析的目的;
判别分析的应用领域非常广泛,例如:
一般来讲,判别变量是数量型测量尺度变量,分析样本个数至少比判别变量多两个,我们为了得到判别函数,经常需要把样本随机分成训练样本和检验样本等工作!
判别函数=分组数-1(一般情况)
下面我们通过案例来操作判别分析并得到判别分析图!
注:分别用第一和第二个判别函数为坐标轴作个体和中心的散点图——偏好图
我们得到数据集,描述了100家用户对某公司产品的7项指标的满意度打分,因变量Y-客户类型:1-新客户、2-犹豫后再次购买、3-再次直接购买;
我们分析的目的是期望得到不同类型的客户,在选购该公司产品方面的影响因素和偏好结构!这样我们可以根据客户类型进行有针对性的改进和营销策略!

7个自变量,也就是影响客户类型的因素指标:
当数据收集好后,这时候要考虑数据集是否有缺省值、是否有未分类等基本描述性统计分析;我们接下来选择判别分析:判别分析在分析菜单的分类子菜单下
在对话框中,我们分别定义自变量和分组变量,其中分组变量要说明组编码取值范围!(我们有三类)
判别分析与多元回归分析一样,都有逐步进入方式,主要目的是通过软件程序和统计算法决定进入判别函数的自变量重要性程度,我们因为需要进行判别图分析,我采用一起全部进入判别方程。
接下来,我们需要在统计量中选择Fisher函数;

我们希望看看判别效果如何,我们可以选择判别图形输出,可以让我们直观看到判别效果!

下面我们看分析结果:首先看判别图,

从图中很明显,看到三个组中心也就是客户类型,以及围绕着组中心的样本,说明分组判别还是不错的,当然这只是直观感觉,我们再看判别分析解释情况:
从表中我们看到,因为分组变量是三类,所以我们得到两个判别函数,其中第一判别函数解释了数据的85.1%,第二判别函数解释了14.9%;两个判别函数解释了100%;当然,两个判别函数直接具有显著的差异和判别力!
Fisher线性判别函数,我们主要用来构建判别方程,理论上说:如果我们知道某个客户在7个指标上的满意度打分,我们就可以估计出该客户应该是哪种类型的客户了!利用的是线性判别函数的得分,得分越大归到某类!
接下来我们考察判别图:(市场研究领域经常采用概念图-偏好图方法解释数据,特别说明的是:判别分析是最理想的构建判别偏好图的方法)
在判别分析结果中,我们可以得到两个典型判别函数的方程系数,分组变量的组中心坐标;我们利用7个指标和组中心的坐标进行偏好图制作,我们把这两张表输出到Excel里,然后再导入到SPSS软件中作散点图;

PASW Statistics也就是SPSS18.0功能有比较大的改进,当然作图方式也有了变化!
从上面的判别分析图中,大家是否会解读呢?
我们可以从圆心向组中心做向量,进行分析,看投影垂点等,解读方法大家可以参考前面的博客文章,《对应分析的七种解读方法》,偏好图和概念图都是一样的解读技术!文章来源:CDA数据分析师官网
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
平均数是数据分析、数理统计与日常运算中最基础、最常用的统计量,核心作用是浓缩一组数据的整体水平、刻画数据集中趋势。在众多 ...
2026-08-24在MySQL数据库中,InnoDB存储引擎作为主流事务型引擎,默认事务隔离级别为可重复读(Repeatable Read,RR),这与SQL Server、Or ...
2026-08-24 很多数据分析师拿到数据就开始清洗、建模,但当被问到“这批数据属于什么类型——结构化还是非结构化?分类变量还是数值变量 ...
2026-08-24 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-08-21在数据分析与数据可视化工作中,直方图是展示数据分布特征、离散程度、集中区间的核心图表,能够直观呈现数值数据的频次分布规律 ...
2026-08-20在数据分析领域有一句核心准则:垃圾数据进,垃圾数据出。数据清洗是数据分析、数据建模、数据可视化之前的必经前置工序,也是保 ...
2026-08-20 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-08-20在Python数据分析与数据清洗工作中,Pandas是最核心的数据处理库,DataFrame是结构化数据的标准存储格式。在实时数据采集、循环 ...
2026-08-19在零售行业大数据分析与精细化运营领域,纸尿裤旁摆放啤酒是最经典、最具代表性的商业案例。两种看似毫无关联的商品,一个是婴幼 ...
2026-08-19 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-08-19在数据分析、业务监控、质量检测与风险管控工作中,数据波动性是衡量数据稳定性、业务健康度、结果可信度的核心依据。数据波动代 ...
2026-08-18很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当导致 ...
2026-08-18在数据分析、业务评价、产品评级、用户分层与综合决策场景中,单一指标往往无法全面、客观地评价事物整体水平。现实中的评价对象 ...
2026-08-18在数理统计、假设检验、数据分析与机器学习领域中,卡方分布(χ²分布)是继正态分布、t分布之后最重要的连续型概率分布之一。 ...
2026-08-17在Python数据清洗、文本校验、账号密码规则校验、脏数据过滤、字符串规整化处理中,正则表达式是最高效、最常用的文本匹配工具。 ...
2026-08-17 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-08-17手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13