上一篇文章给大家分享了一些关于维度表和事实表的内容,今天给大家带来的是关于维度表技术的一些内容,希望对大家有所帮助。
一、维度表结构
1.每个维度表都包含单一的主键列。
3.维度表通常比较宽,是扁平型非规范表,包含大量的低粒度的文本属性。
二、常见维度表技术
1.维度代理键
DW/BI需要申明对所有的维度的主键的空置,无法采用自然键或者附加日期的自然键。最好是建立无语意的整型主键。
2.自然键、持久键、超自然键
自然键,例如员工编号
持久键,有时也被叫做超自然持久键。数据仓库为员工编号创建一个单一键,这个单一键保持永久性不会发生变化。
最后的持久键应该独立于原始的业务过程。
3.下钻
商业分析的基本方法:
上卷(roll-up):上卷是沿着维的层次向上聚集汇总数据。 例如,对产品销售数据,沿着时间维上卷,可以求出所有产品在所有地区每月 (或季度或年或全部)的销售额。
下探(drill-down):下探是上卷的逆操作,它是沿着维的层次向下,查看更详细的数据。
3.空值属性
推荐采用标识性标识空值,例如unknown。因为不同数据库对空值处理不同。
4.日历日期维度
用YYYYMMdd更容易划分。
5.维度子集
一些需求是不需要最细节的数据的,那么此时事实数据需要关联特定的维度,这些特定维度包含在从细节维度选择的行中,因此就叫做维度子集。
细节维度和维度子集具有相同的属性或内容,具有一致性。
(1)建立包含属性子集的子维度
例如需要上钻到子维度。
(2)建立包含行子集的子维度
在两个维度处于同一细节粒度的情况下,如果其中一个仅仅是行的子集,那么就会产生另外一种一致性维度构造子集。
在某些版本的Hive中,对ORC表使用overwrite会出错,为了保持兼用性,通常会使用truncate 。
(3)使用视图实现维度子集
这种方式存在着两个主要问题:一是新创建的子维度是物理表,因此需要额外的存储空间;二是存在数据不一致的潜在风险。
通常的解决方法是在基本维度上建立视图生成子维度。
优点:
a.可以简单实现,不需要修改原来脚本的逻辑;
b.因为视图不真正存储数据,因此不会占用存储空间;
c.将数据不一致的可能消除掉。
缺点:
a.如果基本维度和子维度表数据量相差悬殊的话,性能比物理表差很多;
b.如果定义视图查询,并且视图很多,可能对元数据存储系统造成压力,严重影响查询性能。
6.层次维度
通常我们使用grouping__id 二进制序列,rollup,collect_set,concat_ws等函数。
层次关系方法:固定深度层次进行分组和钻取查询,递归层次结构数据装载、展开与平面化,多路径层次和参差不齐处理
7.退化维度
除了业务主键外没有其他内容的维度表。
8.杂项维度
包含数据具有很少可能值的维度。有时与其为每个标志或属性定义不同的维度,不如建立单独的讲不同维度合并到一起的杂项维度。
9.维度合并
如果几个相关维度的基数都很小,或者具有多个公共属性时,可以考虑合并。
10.分段维度
包含连续的分段度量值,通常用作客户维度的行为标记时间序列,分析客户行为。
数据分析咨询请扫描二维码
数据分析师的工作内容涉及多个方面,主要包括数据的收集、整理、分析和可视化,以支持商业决策和问题解决。以下是数据分析师的一 ...
2024-11-21数据分析师必须掌握的技能可以从多个方面进行归纳和总结。以下是数据分析师需要具备的主要技能: 统计学基础:数据分析师需要 ...
2024-11-21数据分析入门的难易程度因人而异,总体来看,入门并不算特别困难,但需要一定的学习和实践积累。 入门难度:数据分析入门相对 ...
2024-11-21数据分析是一项通过收集、整理和解释数据来发现有用信息的过程,它在现代社会中具有广泛的应用和重要性。数据分析能够帮助人们更 ...
2024-11-21数据分析行业正在迅速发展,随着技术的不断进步和数据量的爆炸式增长,企业对数据分析人才的需求也与日俱增。本文将探讨数据分析 ...
2024-11-21数据分析的常用方法包括多种技术,每种方法都有其特定的应用场景和优势。以下是几种常见的数据分析方法: 对比分析法:通过比 ...
2024-11-21企业数字化转型是指企业利用数字技术对其业务进行改造和升级,以实现提高效率、降低成本、创新业务模式等目标的过程。这一过程不 ...
2024-11-21数据分析作为一个备受追捧的职业领域,吸引着越来越多的女性加入其中。对于女生而言,在选择成为一名数据分析师时,行业选择至关 ...
2024-11-21大数据技术专业主要学习计算机科学、数学、统计学和信息技术等领域的基础理论和技能,旨在培养具备大数据处理、分析和应用能力的 ...
2024-11-21《Python数据分析极简入门》 第2节 3 Pandas数据查看 这里我们创建一个DataFrame命名为df: importnumpyasnpi ...
2024-11-21越老越吃香的行业主要集中在需要长时间经验积累和专业知识的领域。这些行业通常知识更新换代较慢,因此随着年龄的增长,从业者能 ...
2024-11-20数据导入 使用pandas库的read_csv()函数读取CSV文件或使用read_excel()函数读取Excel文件。 支持处理不同格式数据,可指定分隔 ...
2024-11-20大数据与会计专业是一门结合了大数据分析技术和会计财务理论知识的新型复合型学科,旨在培养能够适应现代会计业务新特征的高层次 ...
2024-11-20要成为一名数据分析师,需要掌握一系列硬技能和软技能。以下是成为数据分析师所需的关键技能: 统计学基础 理解基本的统计概念 ...
2024-11-20是的,Python可以用于数据分析。Python在数据分析领域非常流行,因为它拥有丰富的库和工具,能够高效地处理从数据清洗到可视化的 ...
2024-11-20在这个数据驱动的时代,数据分析师的角色变得愈发不可或缺。他们承担着帮助企业从数据中提取有价值信息的责任,而这些信息可以大 ...
2024-11-20数据分析作为现代信息时代的支柱之一,已经成为各行业不可或缺的工具。无论是在商业、科研还是日常决策中,数据分析都扮演着至关 ...
2024-11-20数字化转型已成为当今商业世界的热点话题。它不仅代表着技术的提升,还涉及企业业务流程、组织结构和文化的深层次变革。理解数字 ...
2024-11-20在现代社会的快速变迁中,选择一个具有长期增长潜力的行业显得至关重要。了解未来发展前景好的行业不仅能帮助我们进行职业选择, ...
2024-11-20统计学专业的就业方向和前景非常广泛且充满机遇。随着大数据、人工智能等技术的快速发展,统计学的重要性进一步凸显,相关人才的 ...
2024-11-20