京公网安备 11010802034615号
经营许可证编号:京B2-20210330
sas批量删除重复超过90%的变量
22年前的今天我的妈咪把我带来这个世界,费尽心思把我养到这么大,我就是4月份出生的大白羊,我的生日愿望呢,就是想有个大神在留言板块教我一个怎么识别组合变量更好解释因变量的方法,譬如我怎么知道年龄和婚姻两个变量在一起的效果比单个的效果还要好,但是年龄和性别组合效果并没有那么好。跪求大神实现我的生日愿望吧。
今天还是没有要更新信用评分的内容,更新的内容是关于变量处理中的问题,之前的文章中有过变量处理的章节,这篇文章是对那篇的补充,之前讲过我会把缺失值达到70%的变量删掉。我漏掉一个问题就是变量的重复值达到90%也应该删掉,譬如一个变量有5中情况:ABCDE,但是A的情况的占比就达到90%的时候,除非这个变量剩下的10%全部都是逾期的,不然这样的变量是没有意义,所以今天分享的代码就是批量找出这些变量并在原数据集中删掉。这次的代码也是陈先生提供的。我在陈先生代码的基础上做了一些改动并调试了。
话不多说,上代码:
%macrovar_namelist(data=,tarvar=,dsor=);
%letlib=%upcase(%scan(&data.,1,'.'));
%letdname=%upcase(%scan(&data.,2,'.'));
%globalvar_list var_num;
proc sql ;
create table &dsor.as
select name
from sashelp.VCOLUMN
where left(libname)="&lib."and left(memname)="&dname."and lowcase(name)^=lowcase("&tarvar.");
quit;
%mend;
%macrotest(data,tarvar,data_result,data_drop,rate);
proc datasets lib=work;
delete base;
run;
data base;
length variable$100.;
run;
%var_namelist(data=&data.,/*coltype=num,*/tarvar=&tarvar.,dsor=aa);
data _null_;
set aa;
call symput(compress("var"||left(_n_)),compress(name));
call symput(compress("n"),compress(_n_));
run;
%put&n.;
%doi=1%to&n.;
%put&&var&i.;
proc freq data=&data.(keep=&&var&i.) noprint;
tables &&var&i./out=PERCENT_&&var&i.;
/*(keep=PERCENT)*/
run;
proc sql;
select max(PERCENT) into: max_percent from
PERCENT_&&var&i.;
quit;
%if&max_percent>&rate.%then%do;
data next;
variable="&&var&i.";
run;
proc append base=base data=next force;
run;
%end;
proc datasets lib=work noprint;
delete PERCENT_&&var&i.;
run;
%end;
data base;
set base(where=(variable^=''));
run;
proc transpose data=base out=base1(drop=_name_);
id variable;
run;
/*这步是删除单一变量超过90的重复值的缺失值的可以按照这个写下*/
proc sql noprint;
select name into :var_list separated by' '
from sashelp.VCOLUMN
where upcase(left(libname))="WORK"and UPCASE(left(memname))="BASE1";
quit;
%PUT&var_num1.;
data &data_result.;
set &data.;
drop &var_list.;
run;
data &data_drop.;
set &data.;
keep &tarvar.&var_list.;
run;
%mend;
第一宏不用管,那是为了嵌套在第二个宏里面的。那么接下来介绍下这个宏怎么用。
test(data,tarvar,data_result,data_drop,rate);
data:填入的原数据集。
Tarvar:填入你不想要统计的变量。可以是你的主键也可以是你的因变量,随便你。像我填入的是因变量。
data_result:结果数据集,你的结果数据想叫什么就填什么把。
Data_drop:删掉的变量存放的数据集,给你检查一下有没有错删变量。
Rate:填入的是你觉得重复值达到多少的时候就删掉。我建议的80-90。
下周分享的一个变量人工分段的一个代码。这个代码是我当下除了最优分段之外觉得好用的代码,因为最优分段需要做异常值的检查。有时候异常值检查不好,容易分组的分的不好。这是我个人的经验哈,对于变量分段我之前很崇尚自动分组,我觉得那么多的变量,我一个一个的去细看这无非浪费我的时间,但是我失败的经验告诉我,模型的过程每一步的都应该细致并且仔细,该人工的时候还是要人工,如果全部可以全自动化,那么只要自动运行代码就可以了,谁都可以建模了。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
手游行业具备用户迭代快、竞争激烈、用户粘性易流失的典型特征。随着新游持续上线、玩家审美升级、玩法疲劳等问题出现,存量用户 ...
2026-08-14在数字化产品运营、商业数据分析、业务增长管理中,零散的指标统计无法支撑系统性的业务决策。单一的点击率、转化率、销量数据只 ...
2026-08-14 很多数据分析师每天都在写SQL,但当被问到“数据查询语言(DQL)的本质是什么”“SELECT语句中各子句的书写顺序与实际执行顺 ...
2026-08-14在数据库数据分析、数据清洗、报表统计与业务查询场景中,日期时间是最高频、最核心的基础字段。数据库中存储的日期格式多样,包 ...
2026-08-13在数据统计分析与数据清洗工作中,箱线图是一种简洁高效、客观性强的数据可视化图表,能够直观呈现数据集的分布特征、离散程度和 ...
2026-08-13 很多数据分析师写过无数个SELECT查询,但当被问到“如何新建一张表来固化中间数据”“创建视图和创建物理表有什么区别”“视 ...
2026-08-13在自动化办公、数据采集、定时统计、日志清理、系统监控等场景中,程序往往需要按照固定时间间隔重复执行指定任务,这种运行机制 ...
2026-08-12在数据分析日常工作中,Excel数据筛选是数据清洗、数据提取、样本筛选的核心基础操作。传统Excel手动筛选、函数筛选方式,面对多 ...
2026-08-12 很多数据分析师精通Excel函数和数据透视表,但当被问到“数据从哪里来”“表和视图有什么区别”“数据库管理系统和SQL是什么 ...
2026-08-12在数据分析、统计建模、数据挖掘与商业调研过程中,原始数据往往无法做到绝对干净规整。受系统故障、人工录入失误、设备误差、突 ...
2026-08-11在数据分析工作中,聚类分析是典型的无监督学习方法,核心作用是依据数据自身的多维特征,将相似样本自动划分为若干类别,实现“ ...
2026-08-11 很多企业团队并非缺乏指标,而是陷入“指标失控”:仪表盘上堆满实时跳动的数据,却无法回答“当前瓶颈在哪、下一步该做什么 ...
2026-08-11AB实验是互联网产品迭代、营销优化、功能升级的核心科学验证手段,通过流量随机分组、对照组与实验组对比,科学验证策略、功能、 ...
2026-08-10在MySQL数据库优化中,索引是提升查询效率、降低数据库IO开销、优化系统性能的核心手段。普通单列索引仅适配简单查询场景,面对 ...
2026-08-10 很多数据分析师每天盯着几十个指标,但当被问到“这套指标要支撑什么业务目标”“指标之间是什么逻辑关系”“业务变化时如何 ...
2026-08-10在数字化市场调研体系中,大数据与小数据是两类核心调研数据形态,分别对应海量行为统计与精准样本深度调研。行业普遍存在认知误 ...
2026-08-07数据透视表是Excel、WPS中最核心的数据分析工具,凭借快速汇总、分组统计、动态筛选的优势,被广泛应用于销量统计、业绩复盘、数 ...
2026-08-07 很多数据分析师每天盯着GMV、DAU、转化率,但当被问到“哪些指标在所有行业都适用”“哪些指标只对电商有意义”“二者如何搭 ...
2026-08-07在商品销量、市场需求、营收规模等业务数据中,季节性波动是最普遍、最核心的数据特征。零售快消、食品餐饮、家电服饰、电商行业 ...
2026-08-06在流量红利消退、市场竞争白热化的商业环境中,传统依托经验、跟风投放、广撒网式的营销模式,逐渐暴露出成本高、精准度低、转化 ...
2026-08-06