关于大数据服务上云的思考_数据分析师考试
混合云市场,2014年,IBM以综合的IT能力,收入70亿夺魁。云计算喊了这么多年,不知不觉已经变成了几十亿美元的大生意。云计算时代真的来了!
最近看到亚马逊第一次单独公布AWS财报,一年营收57亿美元,市场份额占比第一。混合云市场,2014年,IBM以综合的IT能力,收入70亿夺魁。云计算喊了这么多年,不知不觉已经变成了几十亿美元的大生意。云计算时代真的来了!
今天不是来说AWS的,说说大数据怎么上云的一些思考:
1、首先说说,大数据和云的关系,云是一种网络形态的概念,是继1980年代大型计算机到客户端-服务器的大转变之后的又一种巨变。云计算(Cloud Computing)是分布式计算(Distributed Computing)、并行计算(Parallel Computing)、效用计算(Utility Computing)、网络存储(Network Storage Technologies)、虚拟化(Virtualization)、负载均衡(Load Balance)、热备份冗余(High Available)等传统计算机和网络技术发展融合的产物。除了技术上的融合形态,更重要的体现了一种服务模式的一种融合和改变,对于云来说,大数据只是上面的一种服务,和其他的web服务,数据库服务没有区别。
2、I层(云的基础设施)现在业界最火的方案是OpenStack,OpenStack是一个由NASA(美国国家航空航天局)和Rackspace合作研发并发起的,以Apache许可证授权的自由软件和开放源代码项目。
OpenStack是一个开源的云计算管理平台项目,由几个主要的组件组合起来完成具体工作。OpenStack支持几乎所有类型的云环境,项目目标是提供实施简单、可大规模扩展、丰富、标准统一的云计算管理平台。OpenStack通过各种互补的服务提供了基础设施即服务(IaaS)的解决方案,每个服务提供API以进行集成。
OpenStack云计算平台,帮助服务商和企业内部实现类似于 Amazon EC2 和 S3 的云基础架构服务(Infrastructure as a Service, IaaS)。OpenStack 包含两个主要模块:Nova 和 Swift,前者是 NASA 开发的虚拟服务器部署和业务计算模块;后者是 Rackspace开发的分布式云存储模块,两者可以一起用,也可以分开单独用。OpenStack除了有 Rackspace 和 NASA 的大力支持外,还有包括 Dell、Citrix、 Cisco、 Canonical等重量级公司的贡献和支持,发展速度非常快。
在云环境中,Openstack解决了I层的问题,所有物理资源的管理和分配由I层来负责。
3、正是因为I层将资源和存储进行了虚拟化然后对上提供,大数据上云最大的两个问题是资源管理和数据存储。同时大数据又是重载的业务,对资源的需求非常高,因此需要大数据和openstack充分配合,大数据上云才能运行的好。
4、传统数据中心,大数据集群的资源管理和分配目前主要的方案是mesos/YARN.
关于大数据服务上云的思考
从上图大家可以看出,Mesos/YARN来对物理资源直接进行管理,然后分配给上层的组件使用。 资源隔离方面,docker方案发展很快,所以又有YARN和kubernets结合的方案。PaaS作为一个服务直接架在YARN上。在没有直接I层能力的情况下,应该是非常合适的一种的过渡方案,但是如果YARN管理的不是直接的物理资源,而是I层虚拟出来的VM/docker之类,mesos/YARN和I层的能力就出现了一定的重合和冲突,这个时候mesos/YARN应该把VM/Docker级资源管理和分配的能力释放给I层,聚焦于job级资源的分配和调度。此时PaaS在架构在YARN/MESOS上就非常多余。
5、对于存储存在同样的问题,HDFS是对物理硬盘的直接抽象成对象存储,并提供3份冗余来保障数据的可靠性。云上的I层对存储通常也会抽象,并且进行一定的冗余,来动态分配给上层应用。HDFS直接架在I层上,就存在反复冗余的问题。同时大数据的核心是对数据的处理,数据存储的位置对性能起到非常关键的作用,多层反复虚拟化之后,数据存储的不确定性,性能损耗非常大。因此I层最好将物理硬盘直接提供出来给大数据服务可见,让用数据的人直接管理数据效率最高。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
“最近复购率一直在下降,我们的营销力度不小啊,为什么用户还是走了?” “是不是广告投放的用户质量不高?还是我们的产品问题 ...
2025-02-21以下文章来源于数有道 ,作者数据星爷 SQL查询是数据分析工作的基础,也是CDA数据分析师一级的核心考点,人工智能时代,AI能为 ...
2025-02-19在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-18当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-17近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的, ...
2025-02-14一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05在数据分析的世界里,“对比”是一种简单且有效的方法。这就像两个女孩子穿同一款式的衣服,效果不一样。 很多人都听过“货比三 ...
2025-02-05当我们只有非常少量的已标记数据,同时有大量未标记数据点时,可以使用半监督学习算法来处理。在sklearn中,基于图算法的半监督 ...
2025-02-05考虑一种棘手的情况:训练数据中大部分样本没有标签。此时,我们可以考虑使用半监督学习方法来处理。半监督学习能够利用这些额 ...
2025-02-04一、数学函数 1、取整 =INT(数字) 2、求余数 =MOD(除数,被除数) 3、四舍五入 =ROUND(数字,保留小数位数) 4、取绝对值 =AB ...
2025-02-03作者:CDA持证人 余治国 一般各平台出薪资报告,都会哀嚎遍野。举个例子,去年某招聘平台发布《中国女性职场现状调查报告》, ...
2025-02-02真正的数据分析大神是什么样的呢?有人认为他们能轻松驾驭各种分析工具,能够从海量数据中找到潜在关联,或者一眼识别报告中的数 ...
2025-02-01现今社会,“转行”似乎成无数职场人无法回避的话题。但行业就像座围城:外行人看光鲜,内行人看心酸。数据分析这个行业,近几年 ...
2025-01-31