京公网安备 11010802034615号
经营许可证编号:京B2-20210330
SPSS:相关分析在游戏中的应用_数据分析师考试
凭借着科技的力量进入了大数据时代,收集数据的能力也大大提高,分析师每天与这些“大”数据打交道。在游戏行业,我们拥有成熟的AARRR模型,从获客、活跃、流失和留存、收入到用户传播建立一个完美的闭环。除了常规指标,在分析过程中我们还会建立很多临时指标来辅助分析,面对这么多统计的数据,我们会好奇这些指标或者变量之间是否存在某种相关性,以及相关程度如何,这就用到我们今天要分享的内容——相关分析。
在统计学上,用相关系数来描述变量之间的关系,相关系数的符号(+/-)表明关系的方向(正相关/负相关),其值的大小表示关系的强弱程度。下图是对相关系数的一个解读。
表1 解释相关系数
| 相关系数的大小 | 一般解释 |
| 0.8~1.0 | 非常强的相关 |
| 0.6~0.8 | 强相关 |
| 0.4~0.6 | 中度相关 |
| 0.2~0.4 | 弱相关 |
| 0.0~0.2 | 弱相关或无相关 |
下面列举几个游戏中进行相关分析的应用场景。
1. 玩家付费能力
评估一个玩家的付费能力与哪些因素相关,相关程度如何?
与一个玩家的付费能力相关的因素有性别、年龄、教育程度、游戏时长、游戏频次甚至游戏中好友数。这些或多或少都与付费能力有一定的相关性。需要注意的是,像性别这样的定类变量不支持下面案例中的实现,需要点二列相关系数。
2. 游戏收入
与游戏每天收入可能相关的因素有付费人数、活跃玩家数、付费率、ARPU、道具销售数量、道具价格和玩家总时长(日玩家总时长),哪些因素与收入相关程度密切,哪些因素相关只是偶然性呢?这些在接下来的案例会详细探讨。
3. 道具销量
游戏中要进行相关分析的地方远不止这三个场景,理论上各个因素都可以进行相关性分析,并通过相关系数反映相关程度,还是建议不要盲目分析,在不同时间段,根据自身的分析目的进行探索式分析和验证。
接下来我们看一个相关分析的案例,工具的选择可以根据个人喜好,虽然Excel也可以进行相关分析,但是只列出相关系数,不能进行统计显著性检验,所以推荐使用SPSS。
首先,整理好要分析的数据,这里收集某游戏两个月内每日收入、玩家数、日付费率、付费人数、道具销售数量等数据。
选择分析->相关->双变量,然后选择要研究的变量如下图:
点击确定后得到分析结果如下:
| 相关性 | ||||||
| 日付费率 | 付费人数 | 道具销量 | 玩家数 | 收入 | ||
| 日付费率 | Pearson 相关性 | 1 | .976** | .542** | .070 | .961** |
| 显著性(双尾) | .000 | .000 | .586 | .000 | ||
| N | 62 | 62 | 62 | 62 | 62 | |
| 付费人数 | Pearson 相关性 | .976** | 1 | .558** | .276* | .954** |
| 显著性(双尾) | .000 | .000 | .030 | .000 | ||
| N | 62 | 62 | 62 | 62 | 62 | |
| 道具销量 | Pearson 相关性 | .542** | .558** | 1 | .195 | .609** |
| 显著性(双尾) | .000 | .000 | .129 | .000 | ||
| N | 62 | 62 | 62 | 62 | 62 | |
| 玩家数 | Pearson 相关性 | .070 | .276* | .195 | 1 | .142 |
| 显著性(双尾) | .586 | .030 | .129 | .272 | ||
| N | 62 | 62 | 62 | 62 | 62 | |
| 收入 | Pearson 相关性 | .961** | .954** | .609** | .142 | 1 |
| 显著性(双尾) | .000 | .000 | .000 | .272 | ||
| N | 62 | 62 | 62 | 62 | 62 | |
| **. 在置信度(双测)为 0.01 时,相关性是显著的。 |
| *. 在置信度(双测)为 0.05 时,相关性是显著的。 |
结果稍微复杂了些(SPSS结果显示比较全面,有些指标不需要关心),我们只选择我们需要的数据来看,只看最后一行(蓝色部分),即收入与其他因素之间的相关性。
从上图结果可知,收入与日付费率和付费人数相关系数分别为0.961和0.954,具有强相关性。收入与道具销量相关系数为0.609,为中度相关。显著性均为0.000远小于0.05,说明分析结果显著。而收入与玩家数(日活跃)相关系数为0.142,弱相关,从显著性检测结果0.272来看大于0.05,说明玩家数对收入相关性不显著,两者存在一定的偶然性。
上面例子中的分析结果并不代表整个游戏行业的数据表现,本文只是传达一个分析方法,在游戏运营中多做一些探索式的相关分析,说不定就能发掘出很大的价值和规律。此外,相关分析只是分析变量之间是否相关以及相关程度如何,并不代表变量之间一定存在因果关系。就像卖冰棍和发生火灾数有很大的相关性,但他们都与温度高(夏天炎热)有关联一样。接下来的文章会讨论回归分析,用数据模型量化这种相关关系,并做一些预测。
CDA学员免费下载查看报告全文:2026全球数智化人才指数报告【CDA数据科学研究院】.pdf
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动运营的时代,指标是连接业务目标与实际行动的核心桥梁,是企业解读业务现状、发现问题、预判趋势的“量化标尺”。一套 ...
2026-05-08在存量竞争日趋激烈的商业时代,“以客户为中心”早已从口号落地为企业运营的核心逻辑。而客户画像作为打通“了解客户”与“服务 ...
2026-05-08 很多数据分析师每天与Excel打交道,但当被问到“什么是表格结构数据”“它和表结构数据有什么区别”“表格结构数据有哪些核 ...
2026-05-08在数据分析、计量研究等场景中,回归分析是探究变量间量化关系的核心方法,无论是简单的一元线性回归,还是复杂的多元线性回归、 ...
2026-05-07在数据分析、计量研究等场景中,回归分析是探究变量间量化关系的核心方法,无论是简单的一元线性回归,还是复杂的多元线性回归、 ...
2026-05-07 很多数据分析师画过趋势图、做过业绩预测,但当被问到“这个月销售额增长20%,到底是长期趋势自然增长,还是促销活动的短期 ...
2026-05-07在数字化时代,商业竞争的核心已从“经验驱动”转向“数据驱动”,越来越多的企业意识到,商业分析不是简单的数据统计与报表呈现 ...
2026-05-06在Excel数据透视表的实操中,“引用”是连接透视表与公式、辅助数据的核心操作,而相对引用作为最基础、最常用的引用方式,其设 ...
2026-05-06 很多数据分析师做过按月份的销售额趋势图,画过按天的流量折线图,但当被问到“时间序列和普通数据有什么本质区别”“季节性 ...
2026-05-06在Excel数据分析中,数据透视表是汇总、整理海量数据的高效工具,而公式则是实现数据二次计算、逻辑判断的核心功能。实际操作中 ...
2026-04-30Excel透视图是数据分析中不可或缺的工具,它能将透视表中的数据快速可视化,帮助我们直观捕捉数据规律、呈现分析结果。但在实际 ...
2026-04-30 很多数据分析师能熟练地计算指标、搭建标签体系,但当被问到“画像到底在解决什么问题”“画像和标签是什么关系”“画像如何 ...
2026-04-30在中介效应分析中,人口统计学变量(如年龄、性别、学历、收入、职业等)是常见的控制变量或调节变量,其处理方式直接影响分析结 ...
2026-04-29在SQL数据库实操中,日期数据的存储与显示是高频需求,而“数字日期”(如20240520、20241231、45321)是很多开发者、数据分析师 ...
2026-04-29 很多分析师在设计标签时思路清晰,但真到落地环节却面临“数据在手,不知如何转化为可用标签”的困境:或因加工方式选择不当 ...
2026-04-29在手游行业竞争日趋白热化的当下,“流量为王”早已升级为“留存为王”,而付费用户留存率更是衡量一款手游盈利能力、运营质量的 ...
2026-04-28在日常MySQL数据库运维与开发中,经常会遇到“同一台服务器上,两个不同数据库(以下简称“源库”“目标库”)的表数据需要保持 ...
2026-04-28 很多分析师每天和数据打交道,但当被问到“标签是什么”“标签和指标有什么区别”“标签体系如何设计”时,却常常答不上来。 ...
2026-04-28箱线图(Box Plot)作为一种经典的数据可视化工具,广泛应用于统计学、数据分析、科研实证等领域,核心价值在于直观呈现数据的集 ...
2026-04-27实证分析是社会科学、自然科学、经济管理等领域开展研究的核心范式,其核心逻辑是通过对多维度数据的收集、分析与解读,揭示变量 ...
2026-04-27