SAS—HASH对象的应用
HASH table原理
先介绍下hash的原理吧。hash table其实就是散列表,也叫哈希表,根据关Key-value键值对而直接进行访问的数据结构。它通过把key-value映射到表中一个位置来访问记录,不用扫描整张表以加快查找的速度。这个映射函数叫做散列函数,存放记录的数组叫做哈希表。
在数据装载时,根据F(key)=内存地址将表存到内存中指定的地址。
比如我最爱的杰伦,根据散列函数F(周杰伦) = 18 就可找到对应的value为87啦。
sas hash table 的优点
hash table是 SAS 查找技术中最为常用的技术啦,性能表现经评测也比较上乘,在SAS 产品中已被广泛使用,同时也深受国外SAS程序员的喜爱,但在国内大家好像并不怎么常用。但是想想可以用sas hash提高下数据查询的效率,是不是在小伙伴面前有些小逼格呢!?
下面呢就介绍下sas hash table的优点:
1.hash table 可以根据 K-V 定位数据,直接得到变量的存储地址,可以减少查询的次数;
2.hash table的变量查找是在内存中进行的,可以提高性能;
3.hash table可以在data步运行时的动态地添加、更新、删除等操作;
4.hash 可以做一些merge 和 proc sql 难以实现的数据集合并,并在细节上可以有更多的控制。
当然,因为sas hash是在内存中运行,所以如果数据太大,还是不要用hash对象了。
sas 定义hash对象
Hash对象的最基本的要点有三个:
(1)要放入内存中的表
(2)用来通过hash函数建立与内存对应存储地址的KEY值(可以是数值、字符或者两者的混合,最好是表的主键否则只有第一条记录有效,因为key值相同通过F(key)只会指向一个地址)。
(3)要调入内存中与key值一起构成数组的变量.
在SAS中分别通过以下步骤来完成上述三个要点:
hash的使用实例
(1)通过hash可以实现表与表的高效关联
(2)可以对hash表中的数据进行控制设计巧妙的算法。下边是一些具体的例子:
使用hash对象来筛选数据
/*新入职员工信息*/
data id_newly;
input id $ epl_ym;
cards
;
1101 201201
1102 201201
1123 201203
1105 201202
1104 201202
1105 201202
;
run;
如下图所示:
/*创建每位员工的销售级别及销售额*/
data sales_all;
input id $ grade $ amt;
cards
;
1001 a 561
1101 c 256
1002 b 421
1003 a 691
1005 a 555
1004 b 398
1015 a 402
1102 c 128
1123 d 96
1105 c 196
1104 d 89
1086 b 632
1093 a 701
1115 c 221
;
run;
如下图所示:
/*使用hash对象筛选新员工的销售额*/
data sales_newly;
length id $8. epl_ym 8.;/*定义数据变量id、epl_ym类型和长度,此处将变量类型和长度写死在程序里,这样当查找表的数据结构发生变化时还要重写代码。以后会单独介绍一下hash 对象处理的技巧。
*/
if _n_ = 1 then do;
declare hash newly(dataset:'id_newly');/*使用数据集id_newly定义hash对象*/
newly.definekey('id');/*其中定义id为主键*/
newly.definedata('epl_ym');/*定义epl_ym为信息变量*/
newly.definedone();/*结束hash对象的初始化*/
end;
set sales_all;
rc = newly.find(key:id);/*调用find方法检索数据集sales_all中的变量id的值是否出现在hash对象的主键中*/
if rc = 0;/*此处注意,find()找到匹配的值返回的是0,这个和其他语言不同。*/
run;
所得结果如下:
2.使用hash对象拼接数据
/*创建销售等级对应的佣金比例数据集*/
data grade;
input grade $ rate;
cards
;
a 0.20
b 0.18
c 0.15
d 0.10
e 0.05
;
run;
结果如下:
/*计算佣金*/
data csm_amt;
if _n_ = 0 then do;
set id_newly grade;
end;
else if _n_ = 1 then do;
declare hash newly(dataset:'id_newly');
newly.definekey('id');
newly.definedata('epl_ym');
newly.definedone();
declare hash grd(dataset:'grade');
grd.definekey('grade');
grd.definedata('rate');
grd.definedone();
end;
call missing (of _all_);
set sales_all;
rc1 = newly.find(key:id);
rc2 = grd.find(key:grade);
if rc1 = 0 then csm_amt = amt*rate;
run;
3.调用definedata 时使用all选项
/*小组信息*/
data team_info;
input team $ open_ym grade employees;
cards
;
a 201201 12 6
b 201202 11 9
c 201205 9 12
d 201506 7 20
e 201205 8 9
f 201206 10 23
;
run;
所得数据集如下:
data employ_new;
input id $ team $;
cards
;
2001 c
2036 d
;
run;
data newly_info;
if _n_ = 0 then do;
set team_info;
end;
else if _n_ = 1 then do;
declare hash t(dataset:'team_info');
t.definekey('team');
t.definedata(all:'yes');
t.definedone();
end;
call missing(of _all_ );
set employ_new;src = t.find();
run;
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-18当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-17近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的, ...
2025-02-14一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05在数据分析的世界里,“对比”是一种简单且有效的方法。这就像两个女孩子穿同一款式的衣服,效果不一样。 很多人都听过“货比三 ...
2025-02-05当我们只有非常少量的已标记数据,同时有大量未标记数据点时,可以使用半监督学习算法来处理。在sklearn中,基于图算法的半监督 ...
2025-02-05考虑一种棘手的情况:训练数据中大部分样本没有标签。此时,我们可以考虑使用半监督学习方法来处理。半监督学习能够利用这些额 ...
2025-02-04一、数学函数 1、取整 =INT(数字) 2、求余数 =MOD(除数,被除数) 3、四舍五入 =ROUND(数字,保留小数位数) 4、取绝对值 =AB ...
2025-02-03作者:CDA持证人 余治国 一般各平台出薪资报告,都会哀嚎遍野。举个例子,去年某招聘平台发布《中国女性职场现状调查报告》, ...
2025-02-02真正的数据分析大神是什么样的呢?有人认为他们能轻松驾驭各种分析工具,能够从海量数据中找到潜在关联,或者一眼识别报告中的数 ...
2025-02-01现今社会,“转行”似乎成无数职场人无法回避的话题。但行业就像座围城:外行人看光鲜,内行人看心酸。数据分析这个行业,近几年 ...
2025-01-31本人基本情况: 学校及专业:厦门大学经济学院应用统计 实习经历:快手数据分析、字节数据分析、百度数据分析 Offer情况:北京 ...
2025-01-3001专家简介 徐杨老师,CDA数据科学研究院教研副总监,主要负责CDA认证项目以及机器学习/人工智能类课程的研发与授课,负责过中 ...
2025-01-29