
SAS—HASH对象的应用
HASH table原理
先介绍下hash的原理吧。hash table其实就是散列表,也叫哈希表,根据关Key-value键值对而直接进行访问的数据结构。它通过把key-value映射到表中一个位置来访问记录,不用扫描整张表以加快查找的速度。这个映射函数叫做散列函数,存放记录的数组叫做哈希表。
在数据装载时,根据F(key)=内存地址将表存到内存中指定的地址。
比如我最爱的杰伦,根据散列函数F(周杰伦) = 18 就可找到对应的value为87啦。
sas hash table 的优点
hash table是 SAS 查找技术中最为常用的技术啦,性能表现经评测也比较上乘,在SAS 产品中已被广泛使用,同时也深受国外SAS程序员的喜爱,但在国内大家好像并不怎么常用。但是想想可以用sas hash提高下数据查询的效率,是不是在小伙伴面前有些小逼格呢!?
下面呢就介绍下sas hash table的优点:
1.hash table 可以根据 K-V 定位数据,直接得到变量的存储地址,可以减少查询的次数;
2.hash table的变量查找是在内存中进行的,可以提高性能;
3.hash table可以在data步运行时的动态地添加、更新、删除等操作;
4.hash 可以做一些merge 和 proc sql 难以实现的数据集合并,并在细节上可以有更多的控制。
当然,因为sas hash是在内存中运行,所以如果数据太大,还是不要用hash对象了。
sas 定义hash对象
Hash对象的最基本的要点有三个:
(1)要放入内存中的表
(2)用来通过hash函数建立与内存对应存储地址的KEY值(可以是数值、字符或者两者的混合,最好是表的主键否则只有第一条记录有效,因为key值相同通过F(key)只会指向一个地址)。
(3)要调入内存中与key值一起构成数组的变量.
在SAS中分别通过以下步骤来完成上述三个要点:
hash的使用实例
(1)通过hash可以实现表与表的高效关联
(2)可以对hash表中的数据进行控制设计巧妙的算法。下边是一些具体的例子:
使用hash对象来筛选数据
/*新入职员工信息*/
data id_newly;
input id $ epl_ym;
cards
;
1101 201201
1102 201201
1123 201203
1105 201202
1104 201202
1105 201202
;
run;
如下图所示:
/*创建每位员工的销售级别及销售额*/
data sales_all;
input id $ grade $ amt;
cards
;
1001 a 561
1101 c 256
1002 b 421
1003 a 691
1005 a 555
1004 b 398
1015 a 402
1102 c 128
1123 d 96
1105 c 196
1104 d 89
1086 b 632
1093 a 701
1115 c 221
;
run;
如下图所示:
/*使用hash对象筛选新员工的销售额*/
data sales_newly;
length id $8. epl_ym 8.;/*定义数据变量id、epl_ym类型和长度,此处将变量类型和长度写死在程序里,这样当查找表的数据结构发生变化时还要重写代码。以后会单独介绍一下hash 对象处理的技巧。
*/
if _n_ = 1 then do;
declare hash newly(dataset:'id_newly');/*使用数据集id_newly定义hash对象*/
newly.definekey('id');/*其中定义id为主键*/
newly.definedata('epl_ym');/*定义epl_ym为信息变量*/
newly.definedone();/*结束hash对象的初始化*/
end;
set sales_all;
rc = newly.find(key:id);/*调用find方法检索数据集sales_all中的变量id的值是否出现在hash对象的主键中*/
if rc = 0;/*此处注意,find()找到匹配的值返回的是0,这个和其他语言不同。*/
run;
所得结果如下:
2.使用hash对象拼接数据
/*创建销售等级对应的佣金比例数据集*/
data grade;
input grade $ rate;
cards
;
a 0.20
b 0.18
c 0.15
d 0.10
e 0.05
;
run;
结果如下:
/*计算佣金*/
data csm_amt;
if _n_ = 0 then do;
set id_newly grade;
end;
else if _n_ = 1 then do;
declare hash newly(dataset:'id_newly');
newly.definekey('id');
newly.definedata('epl_ym');
newly.definedone();
declare hash grd(dataset:'grade');
grd.definekey('grade');
grd.definedata('rate');
grd.definedone();
end;
call missing (of _all_);
set sales_all;
rc1 = newly.find(key:id);
rc2 = grd.find(key:grade);
if rc1 = 0 then csm_amt = amt*rate;
run;
3.调用definedata 时使用all选项
/*小组信息*/
data team_info;
input team $ open_ym grade employees;
cards
;
a 201201 12 6
b 201202 11 9
c 201205 9 12
d 201506 7 20
e 201205 8 9
f 201206 10 23
;
run;
所得数据集如下:
data employ_new;
input id $ team $;
cards
;
2001 c
2036 d
;
run;
data newly_info;
if _n_ = 0 then do;
set team_info;
end;
else if _n_ = 1 then do;
declare hash t(dataset:'team_info');
t.definekey('team');
t.definedata(all:'yes');
t.definedone();
end;
call missing(of _all_ );
set employ_new;src = t.find();
run;
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
机器学习解决实际问题的核心关键:从业务到落地的全流程解析 在人工智能技术落地的浪潮中,机器学习作为核心工具,已广泛应用于 ...
2025-09-09SPSS 编码状态区域中 Unicode 的功能与价值解析 在 SPSS(Statistical Product and Service Solutions,统计产品与服务解决方案 ...
2025-09-09CDA 数据分析师:驾驭商业数据分析流程的核心力量 在商业决策从 “经验驱动” 向 “数据驱动” 转型的过程中,商业数据分析总体 ...
2025-09-09R 语言:数据科学与科研领域的核心工具及优势解析 一、引言 在数据驱动决策的时代,无论是科研人员验证实验假设(如前文中的 T ...
2025-09-08T 检验在假设检验中的应用与实践 一、引言 在科研数据分析、医学实验验证、经济指标对比等领域,常常需要判断 “样本间的差异是 ...
2025-09-08在商业竞争日益激烈的当下,“用数据说话” 已从企业的 “加分项” 变为 “生存必需”。然而,零散的数据分析无法持续为业务赋能 ...
2025-09-08随机森林算法的核心特点:原理、优势与应用解析 在机器学习领域,随机森林(Random Forest)作为集成学习(Ensemble Learning) ...
2025-09-05Excel 区域名定义:从基础到进阶的高效应用指南 在 Excel 数据处理中,频繁引用单元格区域(如A2:A100、B3:D20)不仅容易出错, ...
2025-09-05CDA 数据分析师:以六大分析方法构建数据驱动业务的核心能力 在数据驱动决策成为企业共识的当下,CDA(Certified Data Analyst) ...
2025-09-05SQL 日期截取:从基础方法到业务实战的全维度解析 在数据处理与业务分析中,日期数据是连接 “业务行为” 与 “时间维度” 的核 ...
2025-09-04在卷积神经网络(CNN)的发展历程中,解决 “梯度消失”“特征复用不足”“模型参数冗余” 一直是核心命题。2017 年提出的密集连 ...
2025-09-04CDA 数据分析师:驾驭数据范式,释放数据价值 在数字化转型浪潮席卷全球的当下,数据已成为企业核心生产要素。而 CDA(Certified ...
2025-09-04K-Means 聚类:无监督学习中数据分群的核心算法 在数据分析领域,当我们面对海量无标签数据(如用户行为记录、商品属性数据、图 ...
2025-09-03特征值、特征向量与主成分:数据降维背后的线性代数逻辑 在机器学习、数据分析与信号处理领域,“降维” 是破解高维数据复杂性的 ...
2025-09-03CDA 数据分析师与数据分析:解锁数据价值的关键 在数字经济高速发展的今天,数据已成为企业核心资产与社会发展的重要驱动力。无 ...
2025-09-03解析 loss.backward ():深度学习中梯度汇总与同步的自动触发核心 在深度学习模型训练流程中,loss.backward()是连接 “前向计算 ...
2025-09-02要解答 “画 K-S 图时横轴是等距还是等频” 的问题,需先明确 K-S 图的核心用途(检验样本分布与理论分布的一致性),再结合横轴 ...
2025-09-02CDA 数据分析师:助力企业破解数据需求与数据分析需求难题 在数字化浪潮席卷全球的当下,数据已成为企业核心战略资产。无论是市 ...
2025-09-02Power BI 度量值实战:基于每月收入与税金占比计算累计税金分摊金额 在企业财务分析中,税金分摊是成本核算与利润统计的核心环节 ...
2025-09-01巧用 ALTER TABLE rent ADD INDEX:租房系统数据库性能优化实践 在租房管理系统中,rent表是核心业务表之一,通常存储租赁订单信 ...
2025-09-01