如何利用SAS进行随机抽样-CDA数据分析师官网

热线电话：13121318867

如何利用SAS进行随机抽样

2015-11-26

如何利用SAS进行随机抽样

利用SAS进行随机抽样

在构建数据挖掘模型过程中，有时我们无法对所有的整体进行全面研究，有时我们希望将整体划分为训练集、验证集、测试集三份用于不同目的的数据集，甚至在K-折交叉验证中，我们需要把样本随机的划分为K份数据子集。本文介绍SAS的SURVEYSELECT过程和RANUNI函数在随机抽样方面的应用。

0、读入数据集，并对数据集按分层变量进行排序。本文数据集采用students.txt：

* 从students.txt读入文件到数据集students;

DATA students;

INFILE ‘C:\students.txt’;

INPUT id class $ gender $ math english history chem phys literat;

RUN;

* 查看数据集内容;

PROC PRINT DATA = students;

TITLE ‘Students”s class gender & scores’;

RUN;

* 对二维列联表（班级、性别）进行频数统计;

PROC FREQ DATA = students;

TABLES class * gender /NOPERCENT NOROW NOCOL;

RUN;

* 首先对数据集按分层变量进行排序;

PROC SORT DATA = students;

BY class gender;

RUN;

1、利用SURVEYSELECT过程进行等比例分层抽样

* 利用SURVEYSELECT过程对数据集进行等比例分层抽样;

PROC SURVEYSELECT DATA = students out = samp1 method = srs samprate = .5 seed = 9876;

STRATA class gender;

RUN;

* 查看分层抽样的结果;

PROC FREQ DATA = samp1;

TABLES class * gender /NOPERCENT NOROW NOCOL;

RUN;

2、利用SURVEYSELECT过程进行不等比例分层抽样

* 利用SURVEYSELECT过程对数据集进行等不比例分层抽样;

PROC SURVEYSELECT DATA = students out = samp2 method = srs samprate = (.4 .6 .4 .6 .4 .6)seed = 9876;

STRATA class gender;

RUN;

* 查看分层抽样的结果;

PROC FREQ DATA = samp2;

TABLES class * gender /NOPERCENT NOROW NOCOL;

RUN;

3、利用SURVEYSELECT过程根据抽样数量进行分层抽样

* 利用SURVEYSELECT过程对数据集进行指定数量的分层抽样;

PROC SURVEYSELECT DATA = students out = samp3 method = srs n = (8 4 6 8 5 7) seed =9876;

STRATA class gender;

RUN;

* 查看分层抽样的结果;

PROC FREQ DATA = samp3;

TABLES class * gender /NOPERCENT NOROW NOCOL;

RUN;

4、利用随机数函数RANUNI对数据集进行粗略划分

* 利用RANUNI函数将数据集粗略的划分为N=5份;

DATA s1 s2 s3 s4 s5;

SET students;

r = RANUNI(991889);

IF r<0.2 THEN OUTPUT s1;

ELSE IF r<0.4 THEN OUTPUT s2;

ELSE IF r<0.6 THEN OUTPUT s3;

ELSE IF r<0.8 THEN OUTPUT s4;

ELSE OUTPUT s5;

DROP r;

RUN;

5、利用随机数函数RANUNI对数据集进行精确划分

* 根据数据集创建视图students_v,增加随机数列;

DATA students_v /view=students_v;

SET students;

srt = RANUNI(999890);

RUN;

* 按照随机数列对数据集进行排序,创建数据集students_srt,删除随机数列;

PROC SORT DATA = students_v OUT = students_srt(DROP = srt);

BY srt;

RUN;

* 将数据集精确地划分为N=5份;

DATA s1 s2 s3 s4 s5;

RETAIN per ;

SET students_srt NOBS= total;

IF _N_ = 1 THEN per = INT(total/5);

if _N_<= per then output s1;

ELSE IF _N_<= 2 * per THEN OUTPUT s2;

ELSE IF _N_<= 3 * per THEN OUTPUT s3;

ELSE IF _N_<= 4 * per THEN OUTPUT s4;

ELSE OUTPUT s5;

DROP per;

RUN;

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试教材；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试题库；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想了解CDA院校合作，点击>>> “院校合作” 了解咨询CDA院校合作；

数据挖掘

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇图论在大数据分析中的作用！

下一篇CDA认证再升一档！与国家共同推进大数据人才培养标准教育事业！

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

京公网安备 11010802034615号经营许可证编号：京B2-20210330

联系电话：13321103290 (微信同号)

客服在线

立即咨询

客服在线

立即咨询

免密码登录

提交首次登录验证后自动注册

如何利用SAS进行随机抽样

数据分析师考试动态

CDA报考指南

数据分析学习

数据分析师资讯

【CDA干货】金融行业运营风险监测：核心统计分析方 ...

【CDA干货】基于数据分析的财险潜在客户挖掘与精准 ...

从“杂乱数据”到“分析资产”：CDA数据分析师视角 ...

CDA持证人专访：何显臻谈餐饮行业数据分析与生产管 ...

【CDA干货】如何利用统计学方法开展数据分析：流程 ...

从“数据描述”到“业务预判”：CDA数据分析师视角 ...

【CDA干货】箱线图上下限计算原理、标准流程与异常 ...

【CDA干货】MySQL固定时间间隔数据查询：语法原理、 ...

从“杂乱信号”到“有序资产”：CDA数据分析师视角 ...

CDA持证人专访：周婧博谈会计行业数据分析与经营诊 ...

【CDA干货】问卷调查卡方检验：原理、前提与实战应 ...

从“整体波动”到“因子归因”：CDA数据分析师视角 ...

【CDA干货】单因素方差分析：三组及以上独立样本的 ...

【CDA干货】次日付费留存计算方法、统计口径与业务 ...

从“点状静态”到“时序动态”：CDA数据分析师视角 ...

CDA持证人专访：王晓琳谈数据分析备考与秋招实战经 ...

【CDA干货】用户决策流程全解析：核心环节、影响因 ...

从“标签”到“人”：CDA数据分析师视角下的用户画 ...

【CDA干货】透视表跨表数据应用原理与实战方法 ...

【CDA干货】正态分布异常事件识别与处理方法：数据 ...

CDA教育闭环

常见问题

关于我们

CDA数据分析师公众号

CDA考试中心小程序

CDA数据分析师App下载