通过IMPORT过程读取外部文件数据
通过IMPORT过程读取外部文件数据
除了可以通过DATA步读取外部文本文件数据外,SAS还提供了IMPORT过程,通过它可以从外部数据源读取数据并写入到SAS数据集中。而且,如果使用SAS/ACCESS to PC Files,IMPORT过程除了可以导入带分隔符的文件外,还可以读取PC文件中的外部数据,包括Microsoft Access数据库文件、Miscrosft Excel工作薄、Lotus 1-2-3文件、dBase文件、JMP文件、SPSS文件、Stata文件、Paradox等。SAS变量的定义根据输入记录确定。
在SAS窗口环境选择菜单文件=>导入数据可以打开导入窗口,通过导入向导可读取上述类型的数据。导入过程所生成的SAS语句也可以保存起来供以后使用。
对应于IMPORT过程和SAS窗口环境的IMPORT向导,SAS还提供了EXPORT过程和EXPORT向导(选择菜单文件=>导出数据),以便将SAS数据集中的数据导出到上述类型的文件。对此这里不做讲解,有兴趣的读者可以通过SAS帮助文档学习。
IMPORT过程的导入数据的基本形式如下:
PROC IMPORT
DATAFILE=文件名|文件引用 | DATATABLE=表名
DBMS=数据源标识符
OUT=数据集名称;
RUN;
在上述形式中:
DATAFILE=指定输入文件的完整路径和文件名,或文件引用。文件引用通常通过FILENAME语句指定。
下面给出了几个例子,分别讲解通过IMPORT过程导入CSV文件、Microsoft Excel工作薄和Microsoft Access数据库文件中的数据。
读取CSV文件
外部文件contact.csv的内容如下,文件第一行给出了各个数据行中数据值字段的名称,后面的各行则为对应的字段值。
Name,Age,Position,Marriage,Address
Greg William,42,Manager,Single,"14 Bridge St. San Francisco, CA"
Emily Cooker,33,Sales,Married,"42 Rue Marston"
Henry Cooper,,Office,Married,"52 Rue Marston Paris"
Jimmy Cruze,34,Manager,Single,"Box 100 Cary, NC"
使用IMPORT过程导入该文件的代码如下:
proc import out=saslib.contact
datafile="c:\sas\data\contact.csv"
dbms=csv replace;
getnames=yes;
datarow=2;
run;
proc print data=saslib.contact noobs;
run;
所生成的数据集为saslib逻辑库中的contact数据集,数据文件为c:\sas\data\contact.csv,选项DBMS=指定数据库类型为csv。其中文件扩展名可以省略,SAS会根据DBMS=选项指定的据库类型自行加上。
代码中还使用了REPLACE选项,表示当OUT=指定的数据集存在时覆盖该数据集。GETNAMES语句表示是否从该文件中的第一行读取变量值,默认为YES,表示读取。值为NO表示不读取,这时IMPORT过程会自动产生名为F1、F2、F3的变量等。
DATAROW=语句也会经常使用,用于指定IMPORT语句开始读数据的行号。默认情况下,当GETNAMES=NO时,DATAROW=1,当GETNAMES=NO时,DATAROW=2。该选项可用于跳过数据文件开始处的多行内容。
PRINT过程打印的数据集内容如图2.47所示。
图2.47 PRINT过程打印的数据集
读取 Microsoft Excel 工作薄
IMPORT过程可以导入Microsoft Excel工作薄中的数据。在Excel 2007中文件的工作薄pag的内容如图4.28所示。在该图中,共包含了A~E五列,第一行为字段名称,从第二行开始为数据值。
图2.48 工作薄pag的内容
下面使用IMPORT过程读入该工作薄的指定区域。
proc import out=saslib.contact
datafile="c:\sas\data\contact.xlsx"
dbms=xlsx replace;
range="pag$A1:E5"n;
run;
proc print data=saslib.contact noobs;
run;
IMPORT过程中可以使用RANGE=语句指定所导入的区域。在使用IMPORT过程处理工作薄的数据之前,可先通过Microsoft Excel的“名称管理器”定义要处理的数据的区域,在IMPORT过程中,使用RANGE=语句指定该数据区域的名称,或直接在RANGE=语句中指定数据区域。本例中为直接指定,区域为工作薄为pag的从A1到E5的矩形区域。PRINT过程打印的数据集的内容如图2.49所示。
图2.49
注意:
1) DBMS=XLSX可以处理Microsoft Excel 2007或Microsoft Excel 2010的工作薄。对于其他更早版本的Microsoft Excel生成的工作薄,需使用其他类型,例如XLS、EXCEL4、EXCEL5。
2) 还可使用EXCEL数据库类型EXELCS并通过SAS PC文件服务器来读取相应版本的Excel工作薄。
3) 也可以直接使用LIBNAME语句通过SAS/ACCESS EXCEL引擎来访问Excel工作薄。
具体请参考SAS帮助文档。
通过DBMS=XLS或DBMS=XLSX来读取Excel文件中的数据还有一个好处,即可以直接在UNIX环境下读取Excel工作薄中的数据,不需要访问PC文件服务器。
读取 Microsoft Access 数据库文件
Microsoft Access是一个桌面关系型数据库系统,通常使用Microsoft ACE引擎(.accdb文件格式)或Microsoft Jet引擎(.mdb文件格式)。在IMPORT过程中指定DBMS为ACCESS,SAS可以读取在Microsoft Access 97、Microsoft Access 2000、Microsoft Access 2003、Microsoft Access 2007和Microsoft Access 2010中的文件。例如:
proc import out=saslib.customer
datatable="customer"
dbms=access replace;
database="c:\sas\data\customer.accdb";
RUN;
在IMPORT过程中使用access数据库类型,实际使用的是SAS/ACCESS LIBNAME引擎。也可以直接使用LIBNAME语句通过SAS/ACCESS ACCESS引擎来访问Microsoft Access数据库文件。
DATATABLE=指定输入DBMS表名。数据源可以通过DATAFILE或DATATABLE指定。
DBMS=指定要导入的数据类型。SAS支持多种数据类型,例如CSV、TAB、ACCESS、XLSX、XLS、EXCEL、JMP、DTA、SPASS等。其中CSV、TAB表示要导入的数据文件分别由逗号和tab符号分隔、ACCESS表示使用LIBNAME语句的Miscrosoft Access 表、XLSX表示Micorsoft Excel 2007或2010的工作薄,等等。可参考SAS帮助文档关于导入数据类型和各类型的详细信息。
OUT=指定输出的数据集名称。该语句后面还可以添加数据集选项。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据分析在当今信息时代发挥着重要作用。单因素方差分析(One-Way ANOVA)是一种关键的统计方法,用于比较三个或更多独立样本组 ...
2025-04-25CDA持证人简介: 居瑜 ,CDA一级持证人国企财务经理,13年财务管理运营经验,在数据分析就业和实践经验方面有着丰富的积累和经 ...
2025-04-25在当今数字化时代,数据分析师的重要性与日俱增。但许多人在踏上这条职业道路时,往往充满疑惑: 如何成为一名数据分析师?成为 ...
2025-04-24以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《刘静:10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda ...
2025-04-23大咖简介: 刘凯,CDA大咖汇特邀讲师,DAMA中国分会理事,香港金管局特聘数据管理专家,拥有丰富的行业经验。本文将从数据要素 ...
2025-04-22CDA持证人简介 刘伟,美国 NAU 大学计算机信息技术硕士, CDA数据分析师三级持证人,现任职于江苏宝应农商银行数据治理岗。 学 ...
2025-04-21持证人简介:贺渲雯 ,CDA 数据分析师一级持证人,互联网行业数据分析师 今天我将为大家带来一个关于用户私域用户质量数据分析 ...
2025-04-18一、CDA持证人介绍 在数字化浪潮席卷商业领域的当下,数据分析已成为企业发展的关键驱动力。为助力大家深入了解数据分析在电商行 ...
2025-04-17CDA持证人简介:居瑜 ,CDA一级持证人,国企财务经理,13年财务管理运营经验,在数据分析实践方面积累了丰富的行业经验。 一、 ...
2025-04-16持证人简介: CDA持证人刘凌峰,CDA L1持证人,微软认证讲师(MCT)金山办公最有价值专家(KVP),工信部高级项目管理师,拥有 ...
2025-04-15持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。在实际生活中,我们可能会 ...
2025-04-14在 Python 编程学习与实践中,Anaconda 是一款极为重要的工具。它作为一个开源的 Python 发行版本,集成了众多常用的科学计算库 ...
2025-04-14随着大数据时代的深入发展,数据运营成为企业不可或缺的岗位之一。这个职位的核心是通过收集、整理和分析数据,帮助企业做出科 ...
2025-04-11持证人简介:CDA持证人黄葛英,ICF国际教练联盟认证教练,前字节跳动销售主管,拥有丰富的行业经验。 本次分享我将以教培行业为 ...
2025-04-11近日《2025中国城市长租市场发展蓝皮书》(下称《蓝皮书》)正式发布。《蓝皮书》指出,当前我国城市住房正经历从“增量扩张”向 ...
2025-04-10在数字化时代的浪潮中,数据已经成为企业决策和运营的核心。每一位客户,每一次交易,都承载着丰富的信息和价值。 如何在海量客 ...
2025-04-09数据是数字化的基础。随着工业4.0的推进,企业生产运作过程中的在线数据变得更加丰富;而互联网、新零售等C端应用的丰富多彩,产 ...
2025-04-094月7日,美国关税政策对全球金融市场的冲击仍在肆虐,周一亚市早盘,美股股指、原油期货、加密货币、贵金属等资产齐齐重挫,市场 ...
2025-04-08背景 3月26日,科技圈迎来一则重磅消息,苹果公司宣布向浙江大学捐赠 3000 万元人民币,用于支持编程教育。 这一举措并非偶然, ...
2025-04-07在当今数据驱动的时代,数据分析能力备受青睐,数据分析能力频繁出现在岗位需求的描述中,不分岗位的任职要求中,会特意标出“熟 ...
2025-04-03