京公网安备 11010802034615号
经营许可证编号:京B2-20210330
作者:丁点helper
来源:丁点帮你
上一篇文章介绍了一般线性回归的典型操作,并且留了一个思考题。感谢小伙伴的参与,大家很厉害,没有被迷惑到,线性回归获得的系数代表的是相关关系,而非因果关联。
回归是相关不是因果
多重线性回归,一般是指有多个自变量X,只有一个因变量Y。前面我们主要是以简单线性回归为例在介绍,两者的差距主要在于自变量X的数量,在只有一个X时,就称简单线性回归。
因为,回归的使用仅能说明数据之前存在关联,但这种关联是否真正代表了两者的内在联系还需要更深入的研究。
之所以采用回归分析,就是通过纳入多个自变量,达到控制混杂因素的作用,但是我们无法纳入所有可能的因素,即所谓的“遗漏变量”(omitted variables),从而导致回归的结果不准确。
例如,探究教育程度与收入的关系,如果我们在回归分析中没有纳入“父母的平均教育程度”这个变量,此时,这个变量就被称为“遗漏变量”。
根据常识,父母的教育程度应该是孩子未来收入的重要影响因素,同时也几乎决定了孩子的教育程度。因此,遗漏这个变量有可能让我们得出有偏差的结果(一般会高估个人教育程度对未来收入的影响)。
同时,如果X与Y之间的关系,不是X导致Y,而是Y导致X(称作“反向因果”),此时的回归分析也会得出有统计学意义的结果(总体回归系数不为0)。
但这个结果无法显示相关关系的方向,即无法判断是X→Y,还是Y→X,从而误导我们的判断。
例如,常有人说,一个国家保护私人产权制度越完善,这个国家就越富裕。
这意味着完备的产权促进了国家经济的发展,于是人们建议:贫穷的国家都要实施良好的私有产权保护。
不可否认,产权对提升经济发展的确有作用。但我们不能忽略这其中的反向因果。
也就是说,很有可能是一个国家富裕之后才开始注意产权保护,产权制度才会更加完善,由此,并非是产权促进了经济的发展,而是经济发展促进了产权的完善。
所以,我们不能只从两组数据的相关就推测因果,除了那些没有纳入考虑的变量,反向因果也有可能对我们进行误导。
由此来看,回归分析更像是一种探索,它提供某种线索,启示我们下一步的研究方向。
回归诊断——残差图
多重线性回归,一般是指有多个自变量X,只有一个因变量Y。前面我们主要是以简单线性回归为例在介绍,两者的差距主要在于自变量X的数量,在只有一个X时,就称简单线性回归。
回归分析有时候之所以不能揭示因果,除了上面谈到的遗漏变量效应和反向因果外,某些假设条件的违反也会导致回归的结果不准。
所以,我们要牢记做完回归并不意味着万事大吉,进行必要的诊断性分析十分必要。
回归诊断,就是通过各种方法来验证回归分析的假设条件以及其他因素的影响,这里我们重点讲讲回归LINE条件的诊断和多重共线性的识别。
前文我们提到过做线性回归的时候一般需满足:线性、独立、正态、方差齐(LINE)条件。
对这些假设条件的诊断其实有各种各样的办法,其中一种使用十分广泛,简单易学,同时效率也比较高的做法是作残差图。
画残差图,一般是以回归分析Y的预测值为横轴,以残差为纵轴做散点图。
如果打开SPSS,可以看到回归分析模块中有很多种残差:未标准化、标准化、学生化等等。
简单起见,大家可以选择所谓的“学生化”残差。
不知有同学是否了解过,什么叫“学生化残差”?(不能再古怪了!)
实际上,它和我们前面学习的t检验还有联系。
t检验发明者的笔名就叫“学生”,即student,所以这里的“学生化残差”可以简单理解为一种t变换(与标准化,即z变换类似)。
具体的细节感兴趣的同学可以去查一查。在我们的具体应用中,采用“学生化残差”和“预测值”做散点图还是挺简单的,而且可以发现一些问题。
一条原则:如果线性回归效果较好,则残差图的各个散点会围绕着“残差=0”水平线上下均匀分布,如下图中的红线。
这可能是最简单的诊断方法,通过观察散点在上述红线上下的分布情况来推测回归分析的质量,同时提示需要改进的方向。
例如,下面这张散点图,就提示Y与自变量X之间可能存在某种曲线关系。
当增加某个自变量的二次项后,回归被改善。
没有添加任何二次项
增加x1的二次项,拟合效果提示
除此以外,线性回归诊断另一个常见的问题是,当自变量X之间互相存在高度相关性时,会导致回归方程估计结果不稳定,回归系数的标准误大大增加(可以通过数学公式证明,标准误计算的分母因为X之间的相关系数而变大,从而整个标准误变小),称为共线性。
共线性最大的问题是,导致本身有意义(P<0.05)的结果变为无意义(P>0.05)。
SPSS在线性回归分析模块也有专门的共线性诊断指标,我们在分析时点选即可:
根据上一篇文章中的例子,共线性诊断的的指标均在要求之内,提示共线性问题不严重。
最后,如果线性回归的LINE没有通过诊断分析,需要怎样改进呢?如下图,大家作为参考,这些内容后期有机会我们逐渐给大家讲解。
CDA学员免费下载查看报告全文:2026全球数智化人才指数报告【CDA数据科学研究院】.pdf
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在大数据技术飞速迭代、数字营销竞争日趋激烈的今天,“精准触达、高效转化、成本可控”已成为企业营销的核心诉求。传统广告投放 ...
2026-04-24在游戏行业竞争白热化的当下,用户流失已成为制约游戏生命周期、影响营收增长的核心痛点。据行业报告显示,2024年移动游戏平均次 ...
2026-04-24 很多业务负责人开会常说“我们要数据驱动”,最后却变成“看哪张报表数据多就用哪个”,往往因为缺乏一套结构性的方法去搭建 ...
2026-04-24在Power BI数据可视化分析中,切片器是连接用户与数据的核心交互工具,其核心价值在于帮助使用者快速筛选目标数据、聚焦分析重点 ...
2026-04-23以数为据,以析促优——数据分析结果指导临床技术改进的实践路径 临床技术是医疗服务的核心载体,其水平直接决定患者诊疗效果、 ...
2026-04-23很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标是所有企业都需要的”“哪些指标是因行业而异的”“北极星指标和 ...
2026-04-23近日,由 CDA 数据科学研究院重磅发布的《2026 全球数智化人才指数报告》,被中国教育科学研究院官方账号正式收录, ...
2026-04-22在数字化时代,客户每一次点击、浏览、下单、咨询等行为,都在传递其潜在需求与决策倾向——这些按时间顺序串联的行为轨迹,构成 ...
2026-04-22数据是数据分析、建模与业务决策的核心基石,而“数据清洗”作为数据预处理的核心环节,是打通数据从“原始杂乱”到“干净可用” ...
2026-04-22 很多数据分析师每天盯着GMV、转化率、DAU等数字看,但当被问到“什么是指标”“指标和维度有什么区别”“如何搭建一套完整的 ...
2026-04-22在数据分析与业务决策中,数据并非静止不变的数值,而是始终处于动态波动之中——股市收盘价的每日涨跌、企业月度销售额的起伏、 ...
2026-04-21在数据分析领域,当研究涉及多个自变量与多个因变量之间的复杂关联时,多变量一般线性分析(Multivariate General Linear Analys ...
2026-04-21很多数据分析师精通描述性统计,能熟练计算均值、中位数、标准差,但当被问到“用500个样本如何推断10万用户的真实满意度”“这 ...
2026-04-21在数据处理与分析的全流程中,日期数据是贯穿业务场景的核心维度之一——无论是业务报表统计、用户行为追踪,还是风控规则落地、 ...
2026-04-20在机器学习建模全流程中,特征工程是连接原始数据与模型效果的关键环节,而特征重要性分析则是特征工程的“灵魂”——它不仅能帮 ...
2026-04-20很多数据分析师沉迷于复杂的机器学习算法,却忽略了数据分析最基础也最核心的能力——描述性统计。事实上,80%的商业分析问题, ...
2026-04-20在数字化时代,数据已成为企业决策的核心驱动力,数据分析与数据挖掘作为解锁数据价值的关键手段,广泛应用于互联网、金融、医疗 ...
2026-04-17在数据处理、后端开发、报表生成与自动化脚本中,将 SQL 查询结果转换为字符串是一项高频且实用的操作。无论是拼接多行数据为逗 ...
2026-04-17面对一份上万行的销售明细表,要快速回答“哪个地区卖得最好”“哪款产品增长最快”“不同客户类型的购买力如何”——这些看似复 ...
2026-04-17数据分析师一天的工作,80% 的时间围绕表格结构数据展开。从一张销售明细表到一份完整的分析报告,表格结构数据贯穿始终。但你真 ...
2026-04-16