无论是“小数据”时代还是现在的“大数据”时代,对数据的挖掘、存储、分析和使用从来就不是一件简单的事儿,而且这件事的难度还会随着数据量的增长而变得越来越大。同时,单个企业若是仅仅想要进行数据的存放和处理,去配备一整套Hadoop集群也并不经济。于是,阿里云准备将这件事做成一门生意,帮助企业对他们手中的数据进行存储和分析。
不久前,阿里云正式对外公布了一个叫做ODPS的商用服务。ODPS的全称是Open Data Processing Service,也就是开放数据处理服务。企业可以将来自前端的大量数据集中导入到阿里云中存储,这一点类似于亚马逊此前推出的Redshift数据仓库。
不仅如此。官方还表示,在这个基础上,阿里云将会开放更多的数据分析服务。目前,ODPS开放了SQL功能,以用于数据仓库和日志分析。这就像是Google此前推出的BigQuery——它可以让开发者可以使用Google的架构来运行SQL语句对超级大的数据库进行操作。同样地,现在企业也可以使用ODPS来对数据进行处理了。
在价格和性能方面,ODPS是按照使用量付费的:存储1GB的数据,每个月收取大概0.5元钱左右;阿里云还官方公布了一个数据处理能力供参考:6个小时ODPS可以处理100PB的数据。至于至关重要的商用后的SLA(服务等级协议),ODPS产品经理汤子楠披露了一部分:在技术层面,阿里云承诺放在ODPS中的数据不会泄漏,阿里巴巴和阿里云也不会查看;在服务层面,鉴于不能承诺所有提交的数据处理作业都能计算成功,如果是阿里云方面的原因导致作业失败,那么阿里云则不会收费,而且对于离线作业来说,只对作业成功的那次进行收费。
在此前,ODPS一直被应用于阿里内部的业务系统中,一个典型的应用就是阿里小贷公司的审核和放款流程。阿里巴巴的官方数据称,有超过36万人从阿里小贷借款,最小贷款额为1元,并且能够实现3分钟申请、1秒放款、0人工干预。在这些背后,阿里小贷每天需要处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型……这些都是放在ODPS上存储和分析的。阿里云还表示,淘宝和支付宝等阿里巴巴的部分核心数据业务,也都运行在ODPS平台之上。而在ODPS的产品页面则拿出了阿里巴巴的关联公司天弘基金和众安保险作为案例来进行宣传。
从目前来看,ODPS开放的还只是针对大量数据的数据仓库功能,以及部分数据分析服务。但阿里云显然并不想止步于此。
你可以把阿里云此前一个叫做“御膳房”的服务看作ODPS未来发展方向的缩影。简单来说,“御膳房”实际上是对淘宝和天猫电商数据的挖掘、存储、分析和服务输出的整套服务。在“御膳房”中,淘宝和天猫平台上的大量电商数据被放到ODPS上进行存储,阿里巴巴还引入了第三方ISV(独立软件开发商)来针对这些数据开发分析工具和模型进行分析,最后他们将分析结果拿到服务市场上去销售给卖家——所谓针对淘宝天猫用户进行的精准广告营销,就是通过这种方法得来的。
在ODPS被开放出来之前,“御膳房”完全是阿里巴巴内部的电商平台上生长出来的产物,从数据来源,到数据取向,都是服务于淘宝和天猫平台。而在开放以后,就会有更多类型的企业和数据(包括一些阿里巴巴内部不太擅长处理的非结构化数据)被放在ODPS上,而使用范围也将不仅仅局限于阿里巴巴平台了。
用更加直白的语言来解释就是,ODPS此次作为PaaS被开放了出来进行商用,接下来,企业自身、或者借用ISV开发的工具再在ODPS之上进行数据分析,然后使用这些分析结果。
不过,ODPS现阶段仍有不少问题。汤子楠坦言,对非结构数据的支持将会是ODPS面临的一大挑战。因为ODPS最早是基于阿里巴巴内部的业务成长起来的,而阿里巴巴分析的数据主要是交易数据和用户行为数据——这些数据大多都是结构化和半结构化的。这决定了,ODPS最初开放的服务面向的也都是结构化数据,比如无人分析、数据仓库、BI(商业智能)分析。而随着更多的企业使用ODPS,一定会有大量非结构化的数据放到这个平台上来,这将会是ODPS接下来要探索的很重要的一个方面。
另外则是数据的传输问题。阿里云官方的建议是直接使用ODPS的数据仓库,这样就可以直接调用ODPS之上的分析工具;但如果客户的数据并不存储在阿里云上,也想使用ODPS对数据进行分析,则只能通过API使用https协议传输——这意味着网络传输不得不受到网速的限制。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
以下的文章内容来源于张彦存老师的专栏,如果您想阅读专栏《Python 数据可视化 18 讲(PyEcharts、Matplotlib、Seaborn)》,点 ...
2025-02-28最近,国产AI模型DeepSeek爆火,其创始人梁文峰走进大众视野。《黑神话:悟空》制作人冯骥盛赞DeepSeek为“国运级别的科技成果” ...
2025-02-271.统计学简介 听说你已经被统计学劝退,被Python唬住……先别着急划走,看完这篇再说! 先说结论,大多数情况下的学不会都不是知 ...
2025-02-27“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩稳定, ...
2025-02-26在数据分析工作中,你可能经常遇到这样的问题: 从浏览到消费的转化率一直很低,那到底该优化哪里呢? 如果你要投放广告该怎么 ...
2025-02-25近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的,尤 ...
2025-02-25挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-25在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-25以下文章来源于数有道 ,作者数据星爷 SQL查询是数据分析工作的基础,也是CDA数据分析师一级的核心考点,人工智能时代,AI能为 ...
2025-02-25“最近复购率一直在下降,我们的营销力度不小啊,为什么用户还是走了?” “是不是广告投放的用户质量不高?还是我们的产品问题 ...
2025-02-25在数据分析中,地图是一种非常直观的可视化工具,能够帮助我们更好地理解数据在地理空间上的分布情况。无论是展示销售数据、人口 ...
2025-02-25春风拂面,金三银四的求职季如期而至。谁都想在这场竞争里拿下心仪offer。 一份亮眼简历是求职敲门砖,面试紧张则可能让机会溜 ...
2025-02-24当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05