京公网安备 11010802034615号
经营许可证编号:京B2-20210330
关于缺失统计函数cmiss、nmiss中的小细节
在数据清理中统计缺失变量的缺失的时候,我们经常会用到cmiss函数和nmiss函数,这两者都是用来对缺失个数进行统计,两者区别就在于前者既能用于数值型也能用于字符型,而nmiss则只能用于数值型。
在使用这两个函数的过程中,我们往往会发现在统计缺失个数时候,经常出现实际计算出来的值要大于缺失值的个数,这是为什么呢?
举个简单的例子:
data tmp;
v1=.;v2='';x=3;output;
v1=1;v2='A';x=2;output;
v1=3;v2='';x=.;output;
v1=.;v2='B';x=2;output;
run;
我们得到四行数据,如下所示:
接下来用cmiss函数进行行缺失个数的统计:
data tmp1;
set tmp;
sum_miss=cmiss(of _all_);
run;
最终得到如下结果:
我们发现sum_miss的每一行值都比实际值要大1,为了了解这个过程,我们来通过put语句展示一下过程:
data tmp1;
set tmp;
put _all_;
sum_miss=cmiss(of _all_);
run;
查看日志:
我们发现在统计行缺失时,由于使用的_all_,所以把sum_miss变量也包含进去了,所以才会产生如上结果。
那么为了避免出现这种结果,我们可以用两种办法:
第一种:对sum_miss赋值,例如:
data tmp1;
set tmp;
sum_miss = 0;
sum_miss=cmiss(of _all_);
run;
第二种:将变量列出来,例如:
data tmp1;
set tmp;
sum_miss=cmiss(v1,v2,x);
run;
但是通常情况下,我们还是习惯用第一种方法,因为有时候变量太多,我们又不希望把他们都列出来,所以喜欢采用_all_来表示所有变量。
有童鞋也许会问了,如果我变量很多,但是我又只想对一部分变量进行行缺失统计,那么我该怎么做呢?
方法也很多:
例如可以选择第二种方法,只是需要将你要选择的那些变量用宏变量把他们包含成一列:sum_miss = cmiss(of ¯o_var.);其中宏变量macro_var = v1 v2 x;。
例如可以选择第一种方法,只是在set数据集时,将需要的都keep,前提还是需要将他们用宏变量包含城一列。
等等,根据具体情况,只要灵活结合宏,往往我们都能得到事半功倍的效果。
另外使用cmiss还要一个地方需要注意:
在将cmiss与%sysfunc结合使用时,需要注意对于宏变量是缺失的,我们要用(.)来表示,而不能用空格来表示,例如:
%let a = ;
%let b = hello;
%let c = %sysfunc(cmiss(&a.,&b.));
%put c = &c.;
我们可以看到日志中如下所示:
虽然最终得到了正确的结果,但是程序还是会报错。
那么为了消除这个error,我们需要在宏变量后面再加上一个点号,如下所示:
%let a = ;数据分析师培训
%let b = hello;
%let c = %sysfunc(cmiss(&a..,&b..));
%put c = &c.;
最终在日中中,我们会发现这个error已经去掉了。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据驱动决策的体系中,数据分析按照分析目的可分为描述性分析、诊断性分析、预测性分析与指导性分析四大类型。其中,诊断性分 ...
2026-09-01网络请求是Python爬虫开发、接口测试、数据拉取的核心基础功能,Python生态中主要依靠 urllib 和 requests 两大库实现HTTP请求操 ...
2026-09-01 很多数据分析师面对业务问题时,常常感到“知道要分析,却不知道用什么方法”。其实,数据分析并非无章可循——从三大基础范 ...
2026-09-01在数据库设计与业务数据维护中,自增ID是数据表最常用的主键字段,用于唯一标识每一条业务数据,正常状态下ID应保持连续递增。但 ...
2026-08-31在数理统计、数据分析、经济测算与日常量化评估中,平均值是刻画数据集中趋势、反映整体水平的基础核心指标。在实际应用中,最常 ...
2026-08-31在数据驱动的时代,数据分析早已不是“凭经验、靠感觉”的零散操作,而是一套具备固定逻辑、标准化流程的系统方法——这就是数据 ...
2026-08-31在大数据时代背景下,海量行业数据亟需通过专业化工具挖掘潜在价值,辅助企业业务决策、优化运营模式、规避经营风险。Python凭借 ...
2026-08-28SQL是数据分析领域最基础、最核心的工具,承担着取数、清洗、统计、分层、归因的全流程工作。不同于单纯的语法练习,实战化SQL数 ...
2026-08-28 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-08-28随着新零售模式的快速普及,零售行业从传统的“货品驱动”全面转向“用户驱动”。门店交易数据、线上消费记录、浏览轨迹、复购频 ...
2026-08-27在数据分析、爬虫采集、接口开发、数据归档等场景中,JSON与CSV是两种使用率最高的数据存储格式。JSON为键值对结构化格式,适配 ...
2026-08-27 很多数据分析师每天都在计算指标、制作报表,但当被问到“什么叫指标数据元”“指标数据标准包含哪些核心维度”“指标数据质 ...
2026-08-27在数据分析工作中,时间序列是最常见的数据类型之一,订单时间、日志时间、交易时段、统计周期等数据均离不开时间处理。原始数据 ...
2026-08-26在数据分析与数据预处理工作中,原始数据普遍存在录入错误、系统故障、偶然极值等问题,极易产生异常数据。异常数据会严重干扰数 ...
2026-08-26 很多数据分析师能熟练写SQL、做透视表,但当被问到“数据是从哪里来的?经过哪些加工才进入数据仓库?ETL具体做了什么?”时 ...
2026-08-26在数理统计与数据分析领域,多因素方差分析与线性回归模型是研究变量关系、因素影响、数据差异规律的两大核心工具。二者均属于经 ...
2026-08-25数据分析的核心价值不在于数据计算与图表制作,而在于清晰、精准、有逻辑地输出结论、支撑业务决策。日常数据分析报告普遍存在结 ...
2026-08-25 很多数据分析师能熟练地写SQL、做透视表、算描述性统计,但当被问到“如何预测用户流失概率”“如何归因销量下滑的关键因素 ...
2026-08-25平均数是数据分析、数理统计与日常运算中最基础、最常用的统计量,核心作用是浓缩一组数据的整体水平、刻画数据集中趋势。在众多 ...
2026-08-24在MySQL数据库中,InnoDB存储引擎作为主流事务型引擎,默认事务隔离级别为可重复读(Repeatable Read,RR),这与SQL Server、Or ...
2026-08-24