京公网安备 11010802034615号
经营许可证编号:京B2-20210330
公众号:丁点帮你
作者:丁点helper
最近的生存分析系列文章都是介绍生存曲线的估计方法的,其中一篇讲了如何通过每一例患者的生存时间绘制生存曲线、估计生存率,这种方法被称为K-M法,是因为该方法最早是由Kaplan和Meier这两个人提出的;另一篇讲了如何理解生存率的95%置信区间。
回顾一下前面讲过的例子:为了解肺癌患者接受某种治疗后的生存状况,研究者收集了12名肺癌患者治疗后的住院资料。我们将12名观察对象的生存时间由小到大依次排列,可以计算每个时间点的生存概率,进而计算每个时间点的生存率。
然而在实际工作中,经常会遇到样本含量较大的随访资料,例如大型的队列研究。研究人员只会在计划好的时间点对所有研究对象进行随访(例如每年一次),而不会与每个研究对象持续保持联系,准确记录结局发生/删失发生的具体时间。
因此,某些个体的结局/删失发生在两次随访之间,研究者就不能获得其确切的生存时间,只能确定生存时间的区间。在这种情况下,可将原始资料按照生存时间分组再进行分析。
下面我们用一个例子来看看这种方法是如何实现的。
案例:为了解尘肺患者的生存期,回顾性调查了某煤矿确诊为尘肺的患者1166人,其生存时间列于下表。
与K-M法相比,这一方法中的生存时间由一个确切时间变为了一个时间区间(上表中的『确诊年数 ti』这一列)。
这种变化类似于制作频数分布表的过程,上表是对1166名患者的生存时间做了一个频数分布表,比如第一行中的数据就表示,确诊为尘肺后,寿命少于2年的有51人。教科书中把这样整理数据并估计生存率的方法叫做寿命表法。
接下来我们来一步步搞懂上面这张表。
第(1)~(4)列
在背景中讲过,本案例中患者确切的生存时间无从知晓,只能知道在哪个区间。所以要想把1166名患者的生存时间整合起来,就需要按照生存时间的区间来整理,也就是统计每个区间的人数。
你可能会问,为什么上表是以2年为一个区间呢?其实这个区间的宽度是根据随访时间和观察例数来确定的,可根据实际情况合理调整。
一般每个区间为半闭半开区间,最后一个区间终点在无穷大。本例分成了22个时间区间。
在确定分组区间之后,就要统计每个区间内的死亡人数di、删失人数ci以及期初观察人数ni。第一个时间区间的期初观察人数是所有的观察例数;下一个区间的期初观察例数按以下公式计算:
,这和之前讲过的K-M法是一样的。
第(5)~(7)列
在计算某一时间区间内的死亡概率时,需要用该区间内的死亡人数除以该区间内的观察人数,即
。但是当区间内存在删失时,这些个体并未观察至区间的终点,因此这里用期初观察人数做分母不太妥当。只有当删失数为0时,区间内有效观察人数才等于ni。
在一个特定时间区间内,我们假定删失个体发生的时间是均匀分布的,有的在区间刚开始就删失了,有的则在区间快要结束时才删失。把这些删失个体看做一个整体,相当于一半的个体在区间开始时删失,而另一半则存活到了区间结束。因此,可以认为区间内的有效观察人数为:
也被称为期初校正人数。
接下来每一个时间区间的死亡概率和生存概率也就很好计算了:
比如第三个区间(
),66名患者死亡,死亡概率就是:66/1069.5;对应的生存概率就是:1 - 66/1069.5。
上面的计算中,分母是1069.5,这个数值是怎么来的?计算过程如下:
第(8)~(9)列
接下来的一列就是生存分析中最关心的『生存率
』这一指标了。和之前讲过的一样,各时间点的生存率就是各区间生存概率的乘积。
......注意各时间区间对应的生存率应是该区间上限时间点的生存率,例如上表中第5个区间 [8, 10)对应的生存率为0.7565,意思是某患者确诊为尘肺后预测其活过10年的生存率为75.65%,而不是活过8年的生存率。
最后,再说说为什么要出现表中最后一列『生存率的标准误
』。我们这个表中每个区间的生存率都是用样本计算出来的,要想通过样本了解总体的情况,或者说想估计总体生存率的95%置信区间,就需要用到
。具体解释和计算方法在前文中有详细介绍。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在业务数据分析中,按天拆分统计夜间时段的数据是高频需求——比如电商夜间订单监测、平台夜间用户活跃度分析、运维系统夜间异常 ...
2026-07-29在机器学习建模与特征工程实践中,判断不同特征对模型预测效果的贡献度,是特征筛选、模型解释、业务归因的核心环节。特征置换重 ...
2026-07-29 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-07-29【核心关键词】岗位、数字化、经验、课程、方法论、决策、企业、大方向、数据分析、销售管理、理论知识、思维方式、分析销售、 ...
2026-07-28在问卷调研、用户分群、效果对比等业务数据分析中,分类变量的关联性与差异性验证是高频需求。卡方检验作为针对离散分类数据的经 ...
2026-07-28 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-07-28在Excel数据分析与报表制作中,数据透视表是快速完成多维度汇总、分组统计的核心工具。很多从业者在得到透视表汇总结果后,为了 ...
2026-07-27 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据的基本处理单位是什么”“数据类型误判会引发哪些分析错误”“ ...
2026-07-27当下,我们已然步入数据要素价值全面释放的智能时代。数据不再只是零散的数字记录,更是驱动新质生产力运转的核心动能、滋养人工 ...
2026-07-27【核心关键词】客户、数据分析、指标体系、数据采集、数据指标、业务数据、分析思路、业务需求、分析方法 【专访摘要】本次 CDA ...
2026-07-24在数据分析、业务建模与数字化运营体系中,原始业务数据普遍存在缺失、重复、异常、口径不一致等质量问题,直接用于分析与建模会 ...
2026-07-24 很多数据分析师能熟练计算均值、标准差,但当被问到“如何用一张图让业务方3秒内看懂核心结论”“面对不同数据类型该怎么选 ...
2026-07-24在数据驱动的精细化运营体系中,指标是业务判断、效果复盘、策略优化的核心依据。随着企业数据化程度提升,指标数量持续膨胀,但 ...
2026-07-23在用户运营与产品增长体系中,留存是衡量产品真实价值与用户粘性的核心标尺,也是决定用户生命周期价值、获客投产比的底层因素。 ...
2026-07-23 很多数据分析师精通Excel、SQL、Python等工具,但当被问到“面对一个具体的业务问题,该用什么分析方法”“描述性分析和诊断 ...
2026-07-23【核心关键词】埋点、产品、互联网、数据库、决策、数据分析、产品经理、商业模式、移动互联网、指标体系、运营模块、大数据平 ...
2026-07-22在高并发、大数据量的业务系统中,单表数据量达到千万级甚至亿级后,会出现查询性能骤降、索引维护成本飙升、存储扩容困难等问题 ...
2026-07-22 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-07-22在金融风控、企业运营、行业研究等数据分析场景中,大量数据以面板数据形态存在:例如多家分支机构连续多个季度的风险指标、多位 ...
2026-07-21 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-07-21