京公网安备 11010802034615号
经营许可证编号:京B2-20210330
SAS之DATA步运行机制
相信了解SAS软件的朋友都知道,SAS主要由DATA步和PROC步组成,其中DATA步作为数据读入、清洗、整理的主要程序步,学好DATA就显得尤为重要。而了解DATA步,重中之重就得了解PDV(Logical Program Data Vector)。
首先
DATA步的处理分为两个阶段:
◇编译 ◇执行
编译
由此可知,PDV在DATA步的编译阶段就已存在,那在DATA步的编译阶段究竟发生了什么事呢?
1检查DATA步语句的语法
2创建一个输入缓冲区(input buffer)
3创建一个程序数据向量( PDV)
4创建输出数据集的描述部分(注:只创建描述部分,不赋初值)
执行
1计算Data步迭代的次数(从Data语句开始)
2将PDV中的变量设成缺失值并初始化自动变量
3读取输入观测(从原始文件或SAS数据集)
4执行附加的处理或计算语句
5将一条数据记录写入输出数据集并返回到DATA步语句
输入缓冲区:
SAS在使用input读入外部数据之时,首先需要将外部数据读入内存,即输入缓冲区。(注:当使用set语句之时,则无涉及到输入缓冲区的工作。)
程序数据向量( PDV):
PDV为内存中的一个临时逻辑区域,SAS在建立数据集时,先将每条观测读入PDV,然后执行一系列的语句之后,在遇到output或run语句时,再将观测写入数据集(DATA _NULL_除外)。在PDV中,除当前变量外,还包含两个自动变量:_N_和_ERROR_,前者表示DATA步迭代的次数,后者则表示此次迭代是否出错,若出错则值为1,反之为0。除此之外,还有END=,IN=,FIRST,LAST,POINT=等自动变量。其中END=可做set语句选项,当读入的观测到达最后一行时,该值为1;first、last则存在于使用by语句之时建立,point=选项可用于选择读入某条观测,in=则是数据集选项,用于指示该观测是否从某数据集读入。 这些自动变量并不保存到生成的数据集中,若需保存可将其负值给某一变量。
PDV示例:
在提交此程序之后,编译时,SAS建立一个读入缓冲用以存储原始数据。
而后,建立PDV及变量描述部分如下(长度默认为8)
执行过程中,将变量赋初值(数值型变量空值为.,字符型变量空值为空格)
然后,读入第一条观测
此时DATA步会依次执行data步中附加的语句(此程序示例中无其他执行语句);直到遇到output或run语句时,将第一条观测写入temp数据集中,后开始下一次迭代,直到所有观测均读入。数据分析师培训
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-06-18在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10