京公网安备 11010802034615号
经营许可证编号:京B2-20210330
如何描述回归模型和回归系数
先简单讲一下一元回归。一元回归,即只涉及一个自变量(如X)。这种模型在社会科学中既很少见(一个常见的例外是时间序列分析中以时间为自变量分析因变量的长期趋势),也很容易报告。一般不需用表格,只须写一句话(如“自变量X的b = ?,std = ?, Beta = ?”)或给一个公式(如“Y = ? + ?b, where std = ?, Beta = ?”)就足够了。如果一项研究中有多个一元回归分析,那么就应该也可以用一个表格来报告(参加?),以便于读者对各模型之间作比较。
接下来专门讲多元回归。由于其涉及诸多参数,有的必须报告、有的酌情而定、有完全不必,为了便于说明,我按SPSS回归分析的输出结果(其它统计软件大同小异),做了一个如何报告回归模型和回归系数的一览表(表一)。如表所示,我将各种参数分成“必须报告”、“建议报告”、“一般不必”和“完全不必”四类。我的分类标准来自于公认的假设检验所涉及的四个方面,即变量之间关系的显著性、强度、方向和形式(详见“解释变量关系时必须考虑的四个问题”一文)。也就是说,每个参数的取舍,应该而且可以由其是否提供了不重复的显著性(即Sig)、强度(B或Beta的值)、方向(B或Beta的符号)和形式(自变量的转换)信息而定的。
表一、如何报告回归模型和回归系数之一览表
注1:因变量预测值的标准误差描述了该模型的精确度(precision),如表二中的因变量是当前年薪,其预测误差为?,即如果用该模型(包括起薪、工龄和性别三个自变量)去预测条件相同的企业中的员工年薪,则可以知道?。这种信息无法从模型的其它参数(如R平方或其修正值、显著水平、各自变量的B或Beta)中得知。
注2:如果因变量和所有自变量都没有缺省值,那么模型的个案数就等于样本数。但变量常有缺省值,这时模型的个案数就会小于样本数、有时两者相差很大(当然是个严重问题),所以一定要报告前者。SPSS并不直接显示该信息,但很容易计算,等于 ANOVA表中的Total df + 1就是了。
注3:B的置信区间,是用来检验B的显著水平的另一工具(如果上、下限之间包含了0,说明B在95%的水平上不显著),以弥补t检验及其Sig值的不足。这是一个经典又有复杂的问题,叫做Null Hypothesis Significance Test (NHST),本文不做详谈。有兴趣的读者可以参见有关网页(R. C. Fraley; D. J. Denis)。SPSS不直接给出B的置信区间,需要在“Statistics”一项中要求添加。如右图所示,SPSS回归分析的输出结果中,内定只显示“Estimates” 和”Model fit”两项(即会产生表一中除了置信区间之外的其它各项参数)。建议加选“Confidence intervals”。
现在用一个实例来演示如何报告回归分析结果。为了便于大家重复这个实例,我使用的数据是SPSS自带的world95.sav。这是联合国教科文组织(或世界银行之类机构)发表的1995年全球109个国家或地区的“国情”数据,其中含有人口、地理、经济、社会、文化等26个指标。我以其中的birth_rt(每1000人的出生率)为因变量,gpd_car(人均国内生成总值)、urban(城市化,即人口中城市人口比例)、literacy(识字率、即人口中能阅读者比例)和calories(每天卡路里摄入量)等四项为自变量。按表一的原则,我将该回归分析的结果报告在表二中:
限于篇幅和本文目的,我不对表二的各参数作解读。但想对表中的有关格式做些补充说明。
如何报告多个回归模型?以上是如何报告一个回归模型的结果。实际上,一项研究(即一篇论文)中往往涉及数个回归模型。有些作者喜欢为每个回归做一个类似表二的回归结果表。这种方法有两个问题:一是占用过多的空间、二是不利于对各模型进行比较。一般说来,应该而且可以将平行(即全部自变量相同)或交集(即部分自变量相同)的回归模型结果放在同一个表内。我们还是用world95数据,再对死亡率和AIDS发病率分别做一个回归,然后将三个模型的结果放在表三:
|
表三与表二的主要区别在于表二是横向的(每列为同一类参数)、而表三是纵向(每列为同一模型)。表二中横排的六类参数改成竖立的四行(其中的p值被星号代替、置信区间的上下限合在一行),以便读者做横向比较(这是所有定量分析结果的表格制作的一个基本原则)。如果是英文报告,去掉中文后,表三会变得简洁明了很多。
如何报告变量特征和自变量关系 如前所述,因变量和自变量的特征以及自变量之间的相关关系,是需要酌情考虑的辅助信息。鉴于本文已经很长了,我们简单说一下。变量特征主要指
一种值得推荐的方法,是将所有变量的上述特征列在一个表中(表四)、放到论文的附录中去、供有兴趣的读者查阅(类似的技术细节一般都可以放到附录中去)。
最后我们谈谈好雪的另一问题:如何报告自变量共线性的信息。这其实就是自变量相关问题,初步的检验是看各自变量之间的相关矩阵(可以在上图中添加Descriptive Statistics获得),如果其中有相关系数超过0.50,就有必要作正式的共线性检验(即在上图中选取Collinearity Diagnostics),其会针对每个自变量产生两个统计值:Tolerance和VIF (参见详细解释)。前者是该自变量对所有其它自变量做回归的R2之余数(= 1 – R2,如该自变量与其它自变量中的某些或全部高度相关,Tolerance就会很少、甚至趋于0),而VIF则是Tolerance的倒数。两者只须看其中之一就可以了。一般认为,Tolerance < 0.2或VIF > 5,该变量就有较严重的共线性问题了。 如何报告这类问题?通常和值得推荐的做法是将自变量的相关矩阵表放在附录中,而在论文正文中的方法部分(或结果部分),用文字简单描述一下这些相关系数的最大和最小值。如上所述,如果有系数>0.5,则还有接着用文字分别描述一下这些变量的tolerance值。另外,还可以将Tolerance加到表四(作为新的一列)或自变量相关矩阵表(作为最底部新的一行)中去,但没有必要专门替Tolerance和VIF做一个单独的表格。数据分析培训 |
推荐学习书籍
《CDA一级教材》适合CDA一级考生备考,也适合业务及数据分析岗位的从业者提升自我。完整电子版已上线CDA网校,累计已有10万+在读~

免费加入阅读:https://edu.cda.cn/goods/show/3151?targetId=5147&preview=0
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在统计学分析、实验研究、业务数据复盘过程中,单因素方差分析是检验自变量对因变量是否存在显著影响的核心方法。其中,两个水平 ...
2026-05-26【核心关键词】算法、客户、大数据、互联网、调优、建模、模型优化、机器学习、评分卡模型、模型开发、智能风控、业务场景、数 ...
2026-05-26 很多数据分析师写过无数个 SELECT,但当被问到“新建一张表,该如何定义字段类型来保证数据质量”“创建视图和存储物理表有 ...
2026-05-26在数据清洗、统计分析与数据质量检测工作中,箱型图(又称箱线图、Box Plot)是最直观、最高效的可视化分析工具之一。相较于柱状 ...
2026-05-25在大数据分析、数据清洗、质量管控、风险监测等领域,异常数据识别是保障数据质量、确保分析结论精准、规避业务决策失误的核心基 ...
2026-05-25 很多数据分析师精通Excel函数和透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么关系 ...
2026-05-25数字化经营时代,企业的市场竞争早已从经验决策转向数据决策。门店营收、用户转化、产品销量、成本损耗、存量资产等所有经营行为 ...
2026-05-22在MySQL数据库日常运维、业务数据校验、数据迁移与数据清洗场景中,自增主键ID的连续性校验是一项基础且关键的工作。MySQL的Auto ...
2026-05-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-05-22【核心关键词】大数据、可视化、存储、架构、客户、离线、产品、同步、实时、数据仓库、数据分析、数据可视化、存储数据、离线 ...
2026-05-21在电商流量红利消退、公域获客成本持续走高的当下,存量用户深度挖掘已成为店铺增收增效的核心抓手。相较于付费投放获取的陌生新 ...
2026-05-21 很多数据分析师每天盯着几十个指标,但当被问到“这套指标要支撑什么业务目标”“指标之间是什么逻辑关系”“业务变化时如何 ...
2026-05-21在数据驱动决策的时代,数据质量直接决定分析结果的可靠性与准确性,而异常值作为数据清洗中的核心痛点,往往会扭曲分析结论、误 ...
2026-05-20 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标在所有行业都适用”“哪些指标只对电商有意义”“二者如何搭 ...
2026-05-20Agent的能力边界,很大程度上取决于其掌握的Skill质量和数量。传统做法是靠人工编写和维护Skill,但这条路很快会遇到瓶颈。业务 ...
2026-05-20在统计分析中,方差分析(ANOVA)是一种常用的假设检验方法,核心用于分析“一个或多个自变量对单个因变量的影响”,广泛应用于 ...
2026-05-19 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“什么是指标”“指标和维度有什么区别”“如何定义指标值的计算规则和 ...
2026-05-19想高效备考 CDA 一级,拒绝盲目刷题、冗余学习?《CDA 一级教材知识手册》重磅来袭!以官方教材为核心,浓缩 13 章 103 个核心考 ...
2026-05-19在数据统计分析中,卡方检验是一种常用的非参数检验方法,核心用于判断两个或多个分类变量之间是否存在显著关联,广泛应用于市场 ...
2026-05-18在企业数字化转型的浪潮中,很多企业陷入了“技术堆砌”的误区——上线了ERP、CRM、BI等各类系统,积累了海量数据,却依然面临“ ...
2026-05-18