京公网安备 11010802034615号
经营许可证编号:京B2-20210330
散点图,如果学过我们前面创意图表系列的话,这种图表应该非常熟悉了。
散点图,在图表界有万表之王的称号。
这可不是我随便封的。
美国权威心理学专刊《Journal of the History of the Behavioral Sciences》(行为科学史杂志)在2005年一篇论文中如此评价散点图:
“most versatile, polymorphic, and generally useful invention in the history of statistical graphics”这是信息图表史上功能最多,形式多样,应用范围极为广阔的一个伟大发明!
散点图能获此评价,绝对不是吹出来的。
正如它的名字一样,散点图,可以一堆纷乱如麻,看似无迹可寻的数据显示出内在的关系逻辑来。
散点图已经不仅仅是一个图表了,它已经演化为一个强大的分析工具,可以这么说,散点图,就是为大数据而生的!
下面,还是让我们一起回顾一下散点图的前世今生吧。
认识散点图
散点图,是绘制在X轴和Y轴坐标系中,可以同时表述两个变量的一组数据点。这些大量的数据点组合在一起,形成了一些形状,揭示了数据背后的相关信息。
在这个散点图中,就揭示了不同系列的产品中,销售量与产品收入之间的关系模式。
散点图溯源
说起散点图的来由,如果你读过我们启视录系列前面几篇的话,一定会想到一个名字:William Playfair。这是信息图史上一个神一般的存在,他将折线图、饼图还有条状图带到了我们这个世界上。
可是,这一次你猜错了。
散点图不是普莱费尔发明的。
事实上,散点图的出现如同它的名字一样,散乱不堪,无法理出一个有序的线索出来。
其实,对于散点数据的的视觉化应用,由来已久。好几百年以来,人们一直将这些点放置在地图,或者笛卡尔坐标系中。后来人们逐渐意识到,当这些数据以不同参数,放置在直角坐标系中,很多不为人知的故事会偷偷地浮现出来。于是,散点图逐渐开始流传开来。
所以只能这么说,散点图,是广大数据民工在长期的生产实践中,通过不断的探索和研究,最终发明出来的。
而William Playfair爵士之所以会与这个伟大的发明擦肩而过,主要是因为,他发明的图表都是基于时间序列的,而散点图却不再拘泥于时间这个基本的变量。
散点图从一开始的默默无闻,到最后轰动科学界,直到最后加冕图表之王,其实也就是百十年的事。但是通过散点图带来的很多伟大的发现,则彻底改变了我们的世界观,推动了科学的发展。
1905年,丹麦科学家Danish astronomer Ejnar Hertzprung,在将一些恒星的亮度等级(绝对亮度}和他们的颜色(按光谱从蓝白到红色排列)进行对比的时候,他注意到这其中似乎有着某些相关性。但是他一直没有找到其中的奥秘。
直到1913年,美国天文学家Henry Norris Russell独立发表论文,阐述了这个改变我们认知宇宙的新发现。
没错,正是通过散点图,他将恒星的按光谱和亮度两个参数进行排列分析后发现,从高亮度低光谱(左上)到低亮度高光谱(右下)形成了一条明显的趋势线,而在左上角,还有一团比较密集的数据。
Henry意识到,这条趋势线,或许正揭示了恒星从蓝白色的新星到红色的老星的一个演变的过程,也就是说,他发现了恒星一生的秘密。而左上角的那些数据,则是由一些暮年的红巨星所集合而成。
这就是后来我们所熟知的恒星的一生:原恒星—-主序星—-红巨星—-白矮星—-黑矮星
这是重新绘制的由2200颗恒星数据所组成的Henry Norris Russell散点图,我们的太阳目前大致位于光序1(竖轴)色谱1.0左右的位置上,主序星阶段,正值壮年!
散点图的应用
显而易见,散点图是一种应用非常广泛的图表,而且具有其他图表所没有的独特优势。
不像其他图表的单一特性,散点图不光可以显示趋势,还能显示集群的形状,以及在数据云团中各数据点的关系——这在大数据应用中是极为重要的一点。
无论是探寻肺活量与自由潜水的深度的关系,还是研究地震强度与持续时间之间的关联,或者对比不同部门利润与支出的数据,我们都可以用散点图来进行不同方位解读。
下面就是散点图所经常表现出来的几种趋势:
这里要注意的是,并不是所有的相关关系都是简单的因果关系,要注意其他变量的存在以及对数据的影响。
散点图的最佳设计应用
对于散点图,我们现在已经有了大致的一些了解,现在让我们来看看散点图设计中的一些基本原则吧
这个应该是我们反复强调的了,Y轴从非零开始的话会截断数据,造成误读。
通过改变数据点的大小和颜色,来表示数据值的区别
趋势线可以用来显示数据变化的趋势
太多趋势线,反而搅乱视线。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
日常用Excel做数据管理、台账维护、报表整理时,添加备注列是高频操作——用来标注异常、说明业务背景、记录处理进度、补充关键 ...
2026-03-23作为业内主流的自助式数据可视化工具,Tableau凭借拖拽式操作、强大的数据联动能力、灵活的仪表板搭建,成为数据分析师、业务人 ...
2026-03-23在CDA(Certified Data Analyst)数据分析师的日常工作与认证考核中,分类变量的关联分析是高频核心场景。用户性别是否影响商品 ...
2026-03-23在数据工作的全流程中,数据清洗是最基础、最耗时,同时也是最关键的核心环节,无论后续是做常规数据分析、可视化报表,还是开展 ...
2026-03-20在大数据与数据驱动决策的当下,“数据分析”与“数据挖掘”是高频出现的两个核心概念,也是很多职场人、入门学习者容易混淆的术 ...
2026-03-20在CDA(Certified Data Analyst)数据分析师的全流程工作闭环中,统计制图是连接严谨统计分析与高效业务沟通的关键纽带,更是CDA ...
2026-03-20在MySQL数据库优化中,分区表是处理海量数据的核心手段——通过将大表按分区键(如时间、地域、ID范围)分割为多个独立的小分区 ...
2026-03-19在商业智能与数据可视化领域,同比、环比增长率是分析数据变化趋势的核心指标——同比(YoY)聚焦“长期趋势”,通过当前周期与 ...
2026-03-19在数据分析与建模领域,流传着一句行业共识:“数据决定上限,特征决定下限”。对CDA(Certified Data Analyst)数据分析师而言 ...
2026-03-19机器学习算法工程的核心价值,在于将理论算法转化为可落地、可复用、高可靠的工程化解决方案,解决实际业务中的痛点问题。不同于 ...
2026-03-18在动态系统状态估计与目标跟踪领域,高精度、高鲁棒性的状态感知是机器人导航、自动驾驶、工业控制、目标检测等场景的核心需求。 ...
2026-03-18“垃圾数据进,垃圾结果出”,这是数据分析领域的黄金法则,更是CDA(Certified Data Analyst)数据分析师日常工作中时刻恪守的 ...
2026-03-18在机器学习建模中,决策树模型因其结构直观、易于理解、无需复杂数据预处理等优势,成为分类与回归任务的首选工具之一。而变量重 ...
2026-03-17在数据分析中,卡方检验是一类基于卡方分布的假设检验方法,核心用于分析分类变量之间的关联关系或实际观测分布与理论期望分布的 ...
2026-03-17在数字化转型的浪潮中,企业积累的数据日益庞大且分散——用户数据散落在注册系统、APP日志、客服记录中,订单数据分散在交易平 ...
2026-03-17在数字化时代,数据分析已成为企业决策、业务优化、增长突破的核心支撑,从数据仓库搭建(如维度表与事实表的设计)、数据采集清 ...
2026-03-16在数据仓库建设、数据分析(尤其是用户行为分析、业务指标分析)的实践中,维度表与事实表是两大核心组件,二者相互依存、缺一不 ...
2026-03-16数据是CDA(Certified Data Analyst)数据分析师开展一切工作的核心载体,而数据读取作为数据生命周期的关键环节,是连接原始数 ...
2026-03-16在用户行为分析实践中,很多从业者会陷入一个核心误区:过度关注“当前数据的分析结果”,却忽视了结果的“泛化能力”——即分析 ...
2026-03-13在数字经济时代,用户的每一次点击、浏览、停留、转化,都在传递着真实的需求信号。用户行为分析,本质上是通过收集、整理、挖掘 ...
2026-03-13