你想知道的大数据知识都在这
毋庸置疑,现如今是属于大数据(Big Data)的,革命性的时代。从社交媒体到企业,每时每刻都在产生大量的数据。无所作为,从而把这样的宝藏白白浪费掉是及其愚蠢的。企业已经学会了收集大数据以获取更高的利润,并提供更好的服务以及更深入地了解其目标客户。
大数据主要是指企业中日常生成的,大量的有组织以及无组织的数据。在这种情况下,组织如何处理这些数据,与数据量是无关的。对大数据分析可以产生改善战略商务决策(Strategic business decision-making)的洞察力。
大数据的重要性
如前所述,大数据的价值不在于您拥有多少信息,而在于您要如何利用它。您可以从任何一个点收集数据(并对其进行检查),以找到下面四种情况的解决方案:
物价回降(Price reductions)
时间缩减(Time reductions)
新产品开发,以及改进产品
做出明智的判断
当您耗费大量精力分析聚合大数据时,下面这些业务关联的任务就可能实现:
实时识别故障原因、问题以及缺陷。
根据客户的购买历史,在销售端(Point-of-sale)生成凭证(Voucher)。
在几分钟内计算出特定功能的全部风险。
在欺骗行为影响到您的组织之前,将其检测出来。
▲图1 大数据基础结构
大数据实例
汽车行业 :福特现代混合动力车型 Fusion,它每小时产生高达 25GB 的数据。这些数据可以用于解释驾驶习惯和驾驶模式,以预防意外事故,转向碰撞等情况。
娱乐 :电子游戏行业每天都在使用大数据技术来检查超过 500GB 的有组织数据,以及 4TB 的功能性积压(Functional backlogs)。
社交媒体效应 :每天,社交媒体网站 Facebook 的数据库中都会增加大约 500TB 的新数据。
大数据类型
大数据可以分为以下三大类。
结构化 :可以以固定数据格式存储、处理和改进的数据称为结构化数据。随着时间的推移,如今计算机科学已经能够开发使用这些数据的方法,并从中获得价值。不过近来我们正预测与庞大数量的这类数据相关的问题,这些数据量将成为 ZB(10 亿 TB 等于 1ZB)级别的。
非结构化 :非映射(Unmapped)形式的数据称为非结构化数据。如何从大量的非结构化数据中获取价值,这其中充满挑战。例如,包含了简单文本文件、图片、音频,以及视频录像之集合的异构数据源(Heterogeneous data source),这些数据将难以进行分析。当下,组织拥有大量可用的数据,但不幸的是,他们并何从下手以提取数据的价值,因为这些数据是未经处理的形式。
半结构化 :这可以包含两种形式的数据。另外,我们可以将半结构化数据视为一种形式上的结构,但实际上数据本身并未定义。例如,XML 文件中所描述的数据。
大数据的四个 "V" 值
一些共同特征如图 2 所示。
体积(Volume) :数据量是决定大数据价值的重要因素。因此,体积是处理大数据时需要考虑的一个属性。
种类(Variety) :指的是各种数据源以及数据的性质,这其中既有结构的,也有非结构化的。曾经,电子表格和数据库是大多数实际应用中唯一考虑的数据来源。但现在,调查应用中还会考虑到电子邮件,图片,录音,以及监控设备等形式的数据。
速率(Velocity) :该术语是指 “数据是如何迅速生成的”。数据创建和提炼的速率要有多快,才能满足特定需求,这决定了它的真正潜力。大数据的速率是数据从业务流程、应用程序日志、网站等来源流出的速度。大数据流动的速度非常高,几乎从不间断。
精确性(Veracity) :这是指所生成数据的各种格式之间的不兼容性,这限制了挖掘或管理数据的过程。
▲图2 大数据的特征
大数据架构
大数据架构包含一致的、可扩展的,以及完全计算机化的数据管道(Data pipelines)。构建这种基础架构需要具有深入了解堆中的每一层的能力,即从集群设计(Cluster design)开始,直到设置负责处理数据的顶级链(Top chain)。图 3 展示了堆栈的复杂性以及数据管道工程如何触及其每个部分。
在图 3 中,数据管道收集原始数据并将其转化为有价值的东西。同时,大数据工程师必须计划好数据会发生什么情况,数据存储在集群中的方式,内部许可的访问方式,用于处理数据的设备,以及提供给外界访问的模式。那些设计和实现这种架构的人被称为大数据工程师。
大数据技术
众所周知,大数据的主题非常广泛,并且渗透到了许多新技术的发展中。以下对一些技术的概述旨在帮助用户对大数据进行改造。
1. MapReduce(映射化简):这使得任务的实现具有能够跨越数千台服务器的可扩展性。
Map :将输入数据集转换为一组不同的值。
Reduce : 将 Map 任务的输出联合起来,形成一组简化的值。
2. hadoop:这是 MapReduce 最令人钦佩的执行方式,它是一个完全开源的处理大数据的平台。Hadoop 足够灵活,它能够处理多种数据源,例如聚合数据以进行大规模处理,从数据库读取数据等。
3. Hive:这是一个类似 SQL 的链接,允许 BI(商业智能) 应用程序在 Hadoop 集群旁运行查询。这是由 Facebook 开发的,它已经被开源了一段时间,并且它还是 Hadoop 框架的更高层次的概念。此外,它允许每个人对存储在 Hadoop 集群中的数据进行查询,并改进了 Hadoop 的功能,使其成为了 BI 用户的理想选择。
▲图3 大数据体系结构
大数据处理的优势
处理大数据的能力具有多种益处。
企业可以在进行决策时利用外脑(Outside brainpower):使用来自搜索引擎以及 Facebook 和 Twitter 等网站的社交数据的权利,可以帮助企业改进商务战略。
增强客户服务:客户响应系统正在被使用了大数据技术的新系统所取代。在这些新系统中,大数据技术用于理解与评估消费者的反应。
在早期识别服务风险:可以事先识别风险因素,以提供完美的数据。
提高操作能力:大数据技术可用于在决定将哪些数据移入数据仓库之前,为新数据构建暂存区(Staging areas)或着陆区(Landing zones)。此外,这种大数据和数据仓库技术的结合可帮助企业绕过不经常访问的数据。
挑战
虽然很容易陷入各种关于大数据的炒作之中,但它未得到充分利用的原因之一就是,在使用到它的技术中仍有许多挑战需要解决。其中一些挑战如下:
公司面临着的问题是:识别正确的数据,以及审查如何最好地利用它们。构建与数据有关的商业案例,这往往意味着形成 “开箱即用(Out-of-the-box)” 的意见,以及寻找与传统商业模式截然不同的收入模式。
公司不情愿去挑选同时具有使用新技术和审查数据(以发掘重要的商业洞察)能力的优秀人才。
大量数据点还没有进行链接,公司通常没有合适的平台来整合和管理整个企业的数据。
数据世界的技术发展日新月异。借用数据之力,意味着能够与良好的、具有开拓性的伙伴一起运营 —— 这些公司可以帮助创建正确的 IT 设计,从而以良好的组织方式适应环境的变化。
大数据的可访问性(Accessibility),便宜的硬件产品,以及新的信息管理和分析软件聚合在一起,在数据分析的历史中创造了独特的时刻。我们现在有能力快速且经济高效地审查这些惊人的数据集,这是有史以来的第一次。这种能力象征着真正的飞跃,同时也象征着一个在工作效率、收入和成功方面大幅进步的机会。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
你是否被统计学复杂的理论和晦涩的公式劝退过?别担心,“山有木兮:统计学极简入门(Python)” 将为你一一化解这些难题。课程 ...
2025-03-31在电商、零售、甚至内容付费业务中,你真的了解你的客户吗? 有些客户下了一两次单就消失了,有些人每个月都回购,有些人曾经是 ...
2025-03-31在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的需求持续飙升。世界经济论坛发布的《未来就业报告》, ...
2025-03-28你有没有遇到过这样的情况?流量进来了,转化率却不高,辛辛苦苦拉来的用户,最后大部分都悄无声息地离开了,这时候漏斗分析就非 ...
2025-03-27TensorFlow Datasets(TFDS)是一个用于下载、管理和预处理机器学习数据集的库。它提供了易于使用的API,允许用户从现有集合中 ...
2025-03-26"不谋全局者,不足谋一域。"在数据驱动的商业时代,战略级数据分析能力已成为职场核心竞争力。《CDA二级教材:商业策略数据分析 ...
2025-03-26当你在某宝刷到【猜你喜欢】时,当抖音精准推来你的梦中情猫时,当美团外卖弹窗刚好是你想吃的火锅店…… 恭喜你,你正在被用户 ...
2025-03-26当面试官问起随机森林时,他到底在考察什么? ""请解释随机森林的原理""——这是数据分析岗位面试中的经典问题。但你可能不知道 ...
2025-03-25在数字化浪潮席卷的当下,数据俨然成为企业的命脉,贯穿于业务运作的各个环节。从线上到线下,从平台的交易数据,到门店的运营 ...
2025-03-25在互联网和移动应用领域,DAU(日活跃用户数)是一个耳熟能详的指标。无论是产品经理、运营,还是数据分析师,DAU都是衡量产品 ...
2025-03-24ABtest做的好,产品优化效果差不了!可见ABtest在评估优化策略的效果方面地位还是很高的,那么如何在业务中应用ABtest? 结合企业 ...
2025-03-21在企业数据分析中,指标体系是至关重要的工具。不仅帮助企业统一数据标准、提升数据质量,还能为业务决策提供有力支持。本文将围 ...
2025-03-20解锁数据分析师高薪密码,CDA 脱产就业班助你逆袭! 在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的 ...
2025-03-19在 MySQL 数据库中,查询一张表但是不包含某个字段可以通过以下两种方法实现:使用 SELECT 子句以明确指定想要的字段,或者使 ...
2025-03-17在当今数字化时代,数据成为企业发展的关键驱动力,而用户画像作为数据分析的重要成果,改变了企业理解用户、开展业务的方式。无 ...
2025-03-172025年是智能体(AI Agent)的元年,大模型和智能体的发展比较迅猛。感觉年初的deepseek刚火没多久,这几天Manus又成为媒体头条 ...
2025-03-14以下的文章内容来源于柯家媛老师的专栏,如果您想阅读专栏《小白必备的数据思维课》,点击下方链接 https://edu.cda.cn/goods/sh ...
2025-03-13以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/go ...
2025-03-12以下的文章内容来源于柯家媛老师的专栏,如果您想阅读专栏《小白必备的数据思维课》,点击下方链接 https://edu.cda.cn/goods/sh ...
2025-03-11随着数字化转型的加速,企业积累了海量数据,如何从这些数据中挖掘有价值的信息,成为企业提升竞争力的关键。CDA认证考试体系应 ...
2025-03-10