
散点图大家都能绘制,平常工作汇报有时也会用散点图让报表看起来更美观。但是,散点图并不是为了展示数据,而是需要数据分析,并利用数据分析的结果推动业务的增长。小编今天跟大家分享的这篇文章就是教大家如何用散点图进行数据分析的,希望对大家有所帮助。
文章来源:林骥微信公众号
作者:林骥
你好,我是林骥。
散点图的用途有很多,我认为它的核心价值,在于应用相关思维,发现变量之间的关系。
散点图就像一扇窗,打开它,并仔细观察,能让我们看见更多有价值的信息。
比如说,假设表格中有 10000 个客户年龄和消费金额的数据:
我们可以计算每一个年龄对应的人均消费金额,比如说,所有 20 岁客户的平均消费金额约为 1383.69 元,然后我们可以画出一张散点图:
从图中可以看出,客户的年龄与人均消费金额有很强的相关性,其中应用了线性回归算法,得到一条拟合的直线,并用公式表示出来, 接近于 1 ,代表算法拟合的效果很好。
接下来,我们看看具体实现的步骤。
首先,导入所需的库,并设置中文字体和定义颜色等。
# 导入所需的库 import numpy as np import pandas as pd import matplotlib as mpl import matplotlib.pyplot as plt from sklearn.linear_model import LinearRegression from sklearn.preprocessing import PolynomialFeatures from sklearn.pipeline import Pipeline # 正常显示中文标签 mpl.rcParams['font.sans-serif'] = ['SimHei'] # 自动适应布局 mpl.rcParams.update({'figure.autolayout': True}) # 正常显示负号 mpl.rcParams['axes.unicode_minus'] = False # 禁用科学计数法 pd.set_option('display.float_format', lambda x: '%.2f' % x) # 定义颜色,主色:蓝色,辅助色:灰色,互补色:橙色 c = {'蓝色':'#00589F', '深蓝色':'#003867', '浅蓝色':'#5D9BCF', '灰色':'#999999', '深灰色':'#666666', '浅灰色':'#CCCCCC', '橙色':'#F68F00', '深橙色':'#A05D00', '浅橙色':'#FBC171'}
其次,从 Excel 文件中读取数据,并调用 sklearn 中的算法,得到拟合的直线和评分结果。
# 数据源路径 filepath='./data/客户年龄和消费金额.xlsx' # 读取 Excel文件 df = pd.read_excel(filepath, index_col='客户编号') # 定义画图用的数据:年龄和人均消费金额 df_group = df.groupby('年龄').mean() x = np.array(df_group.index).reshape(-1, 1) y = np.array(df_group.values) # 用管道的方式调用算法,以便把线性回归扩展为多项式回归 poly_reg = Pipeline([ ('ploy', PolynomialFeatures(degree=1)), ('lin_reg', LinearRegression()) ]) # 拟合 poly_reg.fit(x, y) # 斜率 coef = poly_reg.steps[1][1].coef_ # 截距 intercept = poly_reg.steps[1][1].intercept_ # 评分 score = poly_reg.score(x, y)
接下来,开始用「面向对象」的方法进行画图。
# 使用「面向对象」的方法画图,定义图片的大小 fig, ax = plt.subplots(figsize=(8, 6)) # 设置标题 ax.set_title('\n客户每年长一岁,人均消费金额增加' + '%.2f' % coef[0][1] + '元\n', loc='left', size=26, color=c['深灰色']) # 画气泡图 ax.scatter(x, y, color=c['蓝色'], marker='.', s=100, zorder=1) # # 绘制预测线 y2 = poly_reg.predict(x) ax.plot(x, y2, '-', c=c['橙色'], zorder=2) # 隐藏边框 ax.spines['top'].set_visible(False) ax.spines['right'].set_visible(False) ax.spines['bottom'].set_visible(False) ax.spines['left'].set_visible(False) # 隐藏刻度线 ax.tick_params(axis='x', which='major', length=0) ax.tick_params(axis='y', which='major', length=0) ax.set_ylim(15, 65) ax.set_ylim(1000, 5000) # 设置坐标标签字体大小和颜色 ax.tick_params(labelsize=16, colors=c['深灰色']) ax.text(ax.get_xlim()[0]-6, ax.get_ylim()[1], '人\n均\n消\n费\n金\n额', va='top', fontsize=16, color=c['深灰色']) # 设置坐标轴的标题 ax.text(ax.get_xlim()[0]+1, ax.get_ylim()[0]-300, '年龄', ha='left', va='top', fontsize=16, color=c['深灰色']) # 预测 55 岁的人均消费金额 predict = poly_reg.predict([[55]]) # 标注公式 formula = r'$\mathcal{Y} = ' + '%.2f' % coef[0][1] + '\mathcal{X}' + '%+.2f$' % intercept[0] + '\n' + r'$\mathcal{R}^2 = ' + '%.5f$' % score ax.annotate(formula, xy=(55, predict), xytext=(55, predict+500), ha='center', fontsize=12, color=c['深灰色'], arrowprops=dict(arrowstyle='->', color=c['橙色'])) plt.show()
你可以前往 https://github.com/linjiwx/mp 下载数据文件和完整代码。
当业务指标很多的时候,应该挑选什么指标来进行分析,这件事很考验分析者的功力,往往需要对业务有比较深刻的理解。
为什么很多人精通各种工具技术,手上也有很多各种各样的数据,却没有做出让领导满意的图表?
好的图表,就像是给近视的人戴了一副眼镜,让读者以更清楚的方式去理解数据。
好的图表,就像是神奇的催化剂,加快了从数据到决策的过程,让决策者更加快速地掌握有助于做出决策的信息。
好的图表,能把复杂的问题简单化,帮我们更精准地理解业务的现状,甚至预测未来。
我们应该记住,无论多么漂亮的图表,如果不能从中获取有价值的信息,那么也是一张没有「灵魂」的图表。
很多时候,我们面对的问题,并不是没有数据,而是数据太多,却不知道怎么用。
熟悉数据分析的思维,能帮我们找到更重要的数据,排除过多杂乱数据的干扰。
如果把数据分析比作医生看病的过程,那么可以分为以下 4 个阶段:
(1)描述:检查身体,描述指标值是否正常。
(2)诊断:询问病情,找到疾病的产生原因。
(3)预测:分析病情,预测病情的发展趋势。
(4)指导:开出药方,提出有效的治疗建议。
我们要尽可能地理解业务并提供价值,从数据的加工者,转变成故事的讲述者,甚至是问题的解决者。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
PowerBI 累计曲线制作指南:从 DAX 度量到可视化落地 在业务数据分析中,“累计趋势” 是衡量业务进展的核心视角 —— 无论是 “ ...
2025-08-15Python 函数 return 多个数据:用法、实例与实战技巧 在 Python 编程中,函数是代码复用与逻辑封装的核心载体。多数场景下,我们 ...
2025-08-15CDA 数据分析师:引领商业数据分析体系构建,筑牢企业数据驱动根基 在数字化转型深化的今天,企业对数据的依赖已从 “零散分析” ...
2025-08-15随机森林中特征重要性(Feature Importance)排名解析 在机器学习领域,随机森林因其出色的预测性能和对高维数据的适应性,被广 ...
2025-08-14t 统计量为负数时的分布计算方法与解析 在统计学假设检验中,t 统计量是常用的重要指标,其分布特征直接影响着检验结果的判断。 ...
2025-08-14CDA 数据分析师与业务数据分析步骤 在当今数据驱动的商业世界中,数据分析已成为企业决策和发展的核心驱动力。CDA 数据分析师作 ...
2025-08-14前台流量与后台流量:数据链路中的双重镜像 在商业数据分析体系中,流量数据是洞察用户行为与系统效能的核心依据。前台流量与 ...
2025-08-13商业数据分析体系构建与 CDA 数据分析师的协同赋能 在企业数字化转型的浪潮中,商业数据分析已从 “可选工具” 升级为 “核 ...
2025-08-13解析 CDA 数据分析师:数据时代的价值挖掘者 在数字经济高速发展的今天,数据已成为企业核心资产,而将数据转化为商业价值的 ...
2025-08-13解析 response.text 与 response.content 的核心区别 在网络数据请求与处理的场景中,开发者经常需要从服务器返回的响应中提取数 ...
2025-08-12MySQL 统计连续每天数据:从业务需求到技术实现 在数据分析场景中,连续日期的数据统计是衡量业务连续性的重要手段 —— 无论是 ...
2025-08-12PyTorch 中 Shuffle 机制:数据打乱的艺术与实践 在深度学习模型训练过程中,数据的呈现顺序往往对模型性能有着微妙却关键的影响 ...
2025-08-12Pandas 多列条件筛选:从基础语法到实战应用 在数据分析工作中,基于多列条件筛选数据是高频需求。无论是提取满足特定业务规则的 ...
2025-08-12人工智能重塑 CDA 数据分析领域:从工具革新到能力重构 在数字经济浪潮与人工智能技术共振的 2025 年,数据分析行业正经历着前所 ...
2025-08-12游戏流水衰退率:计算方法与实践意义 在游戏行业中,流水(即游戏收入)是衡量一款游戏商业表现的核心指标之一。而游戏流水衰退 ...
2025-08-12CDA 一级:数据分析入门的基石 在当今数据驱动的时代,数据分析能力已成为职场中的一项重要技能。CDA(Certified Data Anal ...
2025-08-12破解游戏用户流失困局:从数据洞察到留存策略 在游戏行业竞争白热化的当下,用户流失率已成为衡量产品健康度的核心指标。一款游 ...
2025-08-11数据时代的黄金入场券:CDA 认证解锁职业新蓝海 一、万亿级市场需求下的数据分析人才缺口 在数字化转型浪潮中,数据已成为企业核 ...
2025-08-11DBeaver 实战:实现两个库表结构同步的高效路径 在数据库管理与开发工作中,保持不同环境(如开发库与生产库、主库与从库)的表 ...
2025-08-08t 检验与卡方检验:数据分析中的两大统计利器 在数据分析领域,统计检验是验证假设、挖掘数据规律的重要手段。其中,t 检验和卡 ...
2025-08-08