作者:丁点helper
来源:丁点帮你
今天我们开始讲什么是卡方分布及卡方检验。
第一个问题是,卡方为什么有平方?
还记得我们在第一篇讲两类错误中谈过的赌场的例子吗,小金赌色子输了很多钱,为了看色子是否有问题,他偷了一颗拿回家想偷偷验证一下是否有人动手脚。
小金闷在家丢了一天,一共丢了902次,而且每一次都做了记录(丢的是昏天黑地,可脑补这个画面)。
下面表格就是小金记录的获得的点数情况,比如一共有242次(27%)出现1点,有56次(6%)出现2点……有196次(22%)出现6点。
实际情况的色子点数
小金怎样通过”狂丢色子“来判断其是否有问题呢?
这就需要用到卡方检验了,实际上也是假设检验的大逻辑。
我们知道小金一共丢了902次,假设这颗色子是正常均匀的,那么每次丢色子,每一点出现的可能性都是1/6,所以理论上每一点出现的次数应该都是:150.33=902/6次。
如下表:我们把每一点实际出现的次数与理论情况下应该出现的次数做一个对比,其中实际观察次数用A表示,理论次数用T表示:
色子点数:理论VS实际
采用假设检验的标准语言来验证就是:
H0:这颗色子是均匀公平,每一点出现的可能性都为1/6;
H1:这颗色子不是均匀公平的,每一点点数出现的概率不都相同;
如果H0假设成立,那么“观察次数”和“理论次数”之间不会差很多;可是如果两者的差距过大,达到我们规定的某个水平,就认为在H0假设成立的情况下是不会出现的,此时就会拒绝原假设,即认为这个色子不是均匀的。
那怎么来计算这个差呢?
依照我们讲标准差的思路,如果直接将实际情况的点数与理论情况点数相减再加和取平均数,基本会得到0的结果,没有什么意义,而取绝对值运算又不方便,所以还是得通过平方。这就是卡方中平方的由来。
卡方值计算
上面这个计算公式,A代表“实际频数”,T代表“理论频数”。
如果把这个公式应用到小金丢色子的例子,就会得到:
卡方值为274.92,其对应的P值小于0.01,也就意味着,如果原假设成立(色子没问题),那么“理论与现实”出现这么大的差距的可能低于5%,我们认为这是不可能,因此,要拒绝原假设,认为“色子有问题”。
所以“十赌九输”是有原因的。
好了,回到今天的正题,小伙伴们可能觉得上面的例子和平常用到的卡方检验好像不太一样。
实际上,原理完全一致。
卡方检验最常用的是检验两个率是否一致,对照上述“丢色子”的例子,我们会先假设这两个率(注意是指总体率)相等,通过相等的总体率,再反推理论发生的频数,然后计算实际的观察频数与理论频数的卡方值来判断差距是否足够大,从而决定假设是否可以被拒绝。
下面以新冠肺炎为例,说明一下卡方检验的应用。
为比较A、B两个城市新冠肺炎病例的检出情况,分别随机抽取A地377人,B地301人,进行核酸检测。结果见下表(数据纯属虚构),现判断两个城市的新冠肺炎检出率是否相同?
如上表,A地的检出率是19.89%;B地的检出率是32.89%,卡方检验就要来判断这两个样本率所代表的总体率是否相等。
现在我们假设它们相等,那怎么计算理论频数呢?
此时就需要用到“合计检出率——25.66% “来算,这个数据就相当于上述色子例子中的1/6,是一个标准。
所以,如果两城市新冠肺炎检出率没有区别,且大概都为25.66%,那理论上A地会检出多少例呢?96.75(377*25.66%),而未检出的就为280.25(377-96.75)。
同理,B地会检出77.25(301*25.66%),未检出的就为223.75(301-77.25)。
现在我们就得到了各城市检出与未检出的理论频数,从而就能计算卡方值。
该卡方值对应的P值小于0.05,所以可以认为A、B两个城市新冠肺炎的检出率不一致,B地检出率更高,感染情况更严重。
数据分析咨询请扫描二维码
基础知识 数据分析领域的入门之路并不是一帆风顺,就像搭建高楼大厦一样,需要坚实的基础。首先,我们来探讨几个关键的基础知识 ...
2024-12-02在当今信息爆炸的时代,数据成为企业决策的关键驱动力。成为一名优秀的数据分析师,并非仅仅掌握数据的本质,更需要具备多方面的 ...
2024-12-02数据收集与整理 数据分析师需要从多个来源收集数据,包括内部数据库、外部市场数据和社交媒体。 清洗和整理数据以确保准确性和 ...
2024-12-02在当今信息爆炸的时代,数据分析扮演着愈发关键的角色。从数据的收集、清洗、分析到最终的报告撰写,数据分析涵盖了广泛而深入的 ...
2024-12-02揭秘数据分析求职之路 在当今竞争激烈的就业市场中,数据分析专业的就业形势备受关注。究竟数据分析领域的求职难度如何?让我们 ...
2024-12-02数据分析就业挑战与应对策略 在当今社会,数据分析专业的就业并非一帆风顺。竞争激烈,技能要求高,许多人发现找工作并不容易。 ...
2024-12-02在追求成为一名出色的数据分析师的道路上,技术和软技能同样重要。技术技能涵盖了诸多方面,其中包括: 统计学知识 探索庞大数据 ...
2024-12-02从技术到软技能:数据分析的全貌 学习数据分析是一项综合性任务,涉及多方面技能。这些技能主要可以划分为技术技能和软技能两大 ...
2024-12-02作为初学者踏入数据分析领域,掌握一系列关键能力至关重要。这些技能不仅涵盖基础工具的使用,还包括深入的分析方法、对业务的理 ...
2024-12-02欢迎探寻数据分析的奇妙世界!对于初学者而言,融会贯通数据领域的复杂性可能有些令人望而却步。然而,不必惊慌,因为我们将一起 ...
2024-12-02欢迎踏上学习数据分析的旅程!数据已经渗透到我们生活的方方面面,成为决策和创新的关键。无论是提升工作效率、探索数据领域还是 ...
2024-12-02欢迎踏上数据分析的学习之旅!无论是为了提升工作效率,转行成为数据分析师,还是满足对数据分析的好奇心,掌握数据分析技能都将 ...
2024-12-02在当今数据驱动的世界中,选择合适的数据分析工具至关重要。不同工具在功能和应用场景上存在显著差异,影响着数据处理和分析的效 ...
2024-12-02选择适合你的数据分析工具 在进行数据分析时,选择合适的工具至关重要。不同工具有各自的特点和适用场景,因此了解每种工具的优 ...
2024-12-021. 技术驱动与市场需求 数据分析领域正随着技术的不断革新而迎来蓬勃发展。大数据、人工智能(AI)、机器学习(ML)等前沿技术的 ...
2024-12-02在当今数字化浪潮中,数据分析扮演着关键角色。数据分析能力的提升引领了行业趋势,深刻影响着各个领域:从技术进步到市场需求增 ...
2024-12-02如何用Excel提升数据分析能力 在数字时代中,数据是无处不在的。对于从业者而言,掌握数据分析的技能至关重要。而在众多数据处理 ...
2024-12-02初探数据分析世界 数据分析是当今数字化时代的核心。无论你是想拓展专业技能还是仅仅对数据分析感兴趣,掌握各种工具至关重要。 ...
2024-12-02从 Excel 到 SQL:打造数据分析之路 数据分析的世界如同辽阔的大海,每个人都可以在其中找到属于自己的航道。无论你是初出茅庐的 ...
2024-12-02在当今信息爆炸的时代,数据已经成为企业决策的关键驱动力。然而,仅有海量数据并不足以带来洞察和价值。数据分析能力的提升是关 ...
2024-12-02