大数据技术如何才能发挥最佳状态_数据分析师考试
过去的经验表明,充分发挥规模化优势能够切实提升分析机制所带来的实践价值。不过如果把大数据看作一柄榔头,可并不是所有问题都属于等待敲下的钉子。
很多人都误以为在大数据解决方案中,处理对象的规模总是越大越好。事实上,人们往往会从不同的立场出发,对“越大越好”这一命题给出自己的答案,而我汇总出了几下几种典型情况:
深信不疑: 这是一种根深蒂固的观念,有些人认为无论实际情况如何,更庞大的规模、更迅捷的速度以及/或者更多样的数据类型总是能够带来更具实践价值的分析结论,而这也正是他们眼中大数据分析的核心价值所在。如果在实际操作中找到理想的结论,那么根据他们的思维方式,这仅仅是由于具体处理者不够努力、不够聪明或者没有使用正确的工具及方法。
盲目迷信: 这种观点认为,大数据的绝对规模本身就是其价值的切实体现,而这与我们是否能够从中获取到实际结论并无关系。根据这种思维方式,如果我们以大数据所支持的特定企业应用程序为出发点对大数据功能进行评估,那么完全不需要像当下分析领域这样迫切需要数据科学家的帮助、而能够任意将数据保存在数据湖当中以支持未来的探索活动。
视为负担: 这种观点认为,数据的庞大规模并不是带来正面或者负面结果的必要条件。不过有一项事实明确而不容否认,即现有数据库在存储与处理能力方面的匮乏根本无力负担大数据的高强度负载,因此需要新的平台加以支撑(例如Hadoop)。如果我们不能将发展脚步与数据的迅猛增长保持一致,那么这种观点认为企业的当务之急是将核心业务转移到新型数据库当中。
绝佳机遇: 就我个人而言,这才是看待大数据的正确方式。其核心实质在于随着数据规模的不断扩大、数据流速度的不断提升以及数据来源与格式的持续增长,我们需要以更加快捷而有效的方式所数据中提取出前所未有的分析结论。这种观点不会迷信或者过度依赖大数据,因为我们承认某些结论完全可以通过小规模数据分析方式得出。同时,这种观点也不会将数据规模视为一种负担,而单纯只是需要通过新型数据库平台、工具以及实践方案解决的另一项技术挑战。
去年,我曾在一篇博文中谈到大数据中的核心用例,主要探讨角度是从“绝佳机遇”层面出发。而去年年底,我通过亲身观察发现大数据的核心“业务”价值主要受到增量化内容在提供增量化背景信息方面的影响。如果大家希望通过数据分析来了解事物的全貌以及蕴藏在其背后的深层含义,那么背景信息总是越多越好。同理,如果大家希望将与当前问题相关的所有变量、关系以及模式进行全面考量的话,内容也总是越多越好。总体而言:更多背景信息加上更多相关内容通常意味着更大的数据规模。
大数据的价值还更多地体现在其纠正错误的能力,这种价值在小规模数据当中往往很难体现。在博文中,我曾援引某位第三方数据科学家的观察结果,发现培训信息集合当中包含的数量量越小、几类常见风险状况的发生可能性就越高。首先,小规模数据往往会令我们忽视某些至关重要的预测性变量。大家也有可能对某些切实具备代表性的样本信息产生误解。除此之外,大家往往能够在具备更为复杂并能切实体现底层工作关系的数据集的前提下,保证自身将某些虚假的相关性联系排除出去。
规模化的美好
相信每个人都已经意识到,某些数据类型及特定用例在规模化条件下能够比其它资源带来更出色的分析结论推动作用。
在这方面,我最近发现了一篇非常出色的评述文章,其中对一种特殊类型的数据——也就是低密度细化行为数据——进行了深入阐释,指出其能够在规模化条件下显著提高预测性分析的准确率。该文作者Junqué de Fortuny、Martens以及Provost指出,“此类数据集的关键特性在于其低密度:对于任何给定实例,绝大多数特征对于实际价值的贡献为零、或者说‘没有意义’。”
其中最值得注意的(作者们也引用了大量研究资料来支持他们的讨论)是,此类数据已经成为不少关注于客户分析任务的大数据应用程序的核心所在。社交媒体行为数据完全满足以上描述,而Web浏览行为数据、移动行为数据、广告响应行为数据以及自然语言行为数据等等也全部与之相符。
“事实上,”三位作者指出,“对于大多数常见的预测分析型业务应用程序来说,例如针对银行及电信、信用评分以及资源消耗管理等任务的应用,此类数据已经被普遍作为预测性分析的关键性素材……其特性往往体现在人口、地理位置以及个人心理倾向方面,并且包括对特定行为的统计汇总——例如企业此前进行过的采购行为。”
在谈到规模较大的行为数据集往往比小规模数据集更具分析价值的核心原因时,三位作者指出:“少数特定的已知行为往往无法在没有庞大数据量作为依托的前提下被准确观察得出。”这是因为在小型数据集当中,除非其表现超出预先设定的具体范围,否则个人行为是不会被记录下来的。但当我们把目光投向所有相关人员整体,很有可能会观察到那些仅仅出现过数次甚至一次、但却指向特定利基层面的特殊行为类型。在小规模数据集当中,由于对象数量与行为特征相对有限,我们很可能会忽略掉上述更为丰富的细节信息。
行为数据集的来源越丰富、预测模型就越能获得理想的施展空间,从而为未来可能出现的更为广泛的潜在场景提供更具参考价值的预测结论。因此,规模越大通常意味着分析效果越好。
有时候越大意味着越难理解
尽管如此,三位作者也注意到在某些情况下、上述结论可能并不成立,而这一切都要归结于特定行为特征的预测价值层面。基本上,权衡机制充当着行为预测模型的基础。
每一种被纳入到预测模型内的新型增量化行为特征都应当具备与分析目标的高度相关性,只有这样才能提高分析收益并保证预测模型有能力克服更显著的内容差异化状况——也就是过度拟合与错误预测——但这往往需要有规模更大的功能集作为依托。正如几位作者指出:“如果不能对模型进行平衡与改进(假定已经选定了正确的数据子集),与核心主旨无关的大量信息只会增加出现偏差与过度拟合状况的机率。”
很明显,当不利于得出预测性结论时,数据规模并非越大越好。相信没人愿意在大数据分析过程中受到其臃肿规模的严重拖累。在这种情况下,我们的数据科学家则需要开动脑筋,想办法将导入模型的数据规模尽量缩小、从而使其最大程度与当前分析任务的特性相匹配。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
数据分析报告至关重要 一份高质量的数据分析报告不仅能够揭示数据背后的真相,还能为企业决策者提供有价值的洞察和建议。 年薪70 ...
2025-01-24又到一年年终时,各位打工人也迎来了展示成果的关键时刻 —— 年终述职。一份出色的年终述职报告,不仅能全面呈现你的工作价值, ...
2025-01-23“用户旅程分析”概念 用户旅程图又叫做用户体验地图,它是用于描述用户在与产品或服务互动的过程中所经历的各个阶段、触点和情 ...
2025-01-22在竞争激烈的商业世界中,竞品分析对于企业的发展至关重要。今天,我们就来详细聊聊数据分析师写竞品分析的那些事儿。 一、明确 ...
2025-01-22在数据分析领域,Excel作为一种普及率极高且功能强大的工具,无疑为无数专业人士提供了便捷的解决方案。尽管Excel自带了丰富的功 ...
2025-01-17在这个瞬息万变的时代,许多人都在寻找能让他们脱颖而出的职业。而数据分析师,作为大数据和人工智能时代的热门职业,自然吸引了 ...
2025-01-14Python作为一门功能强大的编程语言,已经成为数据分析和可视化领域的重要工具。无论你是数据分析的新手,还是经验丰富的专业人士 ...
2025-01-10完全靠数据决策,真的靠谱吗? 最近几年,“数据驱动”成了商界最火的关键词之一,但靠数据就能走天下?其实不然!那些真正成功 ...
2025-01-09SparkSQL 结构化数据处理流程及原理是什么?Spark SQL 可以使用现有的Hive元存储、SerDes 和 UDF。它可以使用 JDBC/ODB ...
2025-01-09在如今这个信息爆炸的时代,数据已然成为企业的生命线。无论是科技公司还是传统行业,数据分析正在深刻地影响着商业决策以及未来 ...
2025-01-08“数据为王”相信大家都听说过。当前,数据信息不再仅仅是传递的媒介,它成为了驱动经济发展的新燃料。对于企业而言,数据指标体 ...
2025-01-07在职场中,当你遇到问题的时候,如果感到无从下手,或者抓不到重点,可能是因为你掌握的思维模型不够多。 一个好用的思维模型, ...
2025-01-06在现代企业中,数据分析师扮演着至关重要的角色。每天都有大量数据涌入,从社交媒体到交易平台,数据以空前的速度和规模生成。面 ...
2025-01-06在职场中,许多言辞并非表面意思那么简单,有时需要听懂背后的“潜台词”。尤其在数据分析的领域里,掌握常用术语就像掌握一门新 ...
2025-01-04在当今信息化社会,数据分析已成为各行各业的核心驱动力。它不仅仅是对数字进行整理与计算,而是在数据的海洋中探寻规律,从而指 ...
2025-01-03又到一年年终时,各位打工人也迎来了展示成果的关键时刻 —— 年终述职。一份出色的年终述职报告,不仅能全面呈现你的工作价值, ...
2025-01-03在竞争激烈的商业世界中,竞品分析对于企业的发展至关重要。今天,我们就来详细聊聊数据分析师写竞品分析的那些事儿。 一、明确 ...
2025-01-03在数据分析的江湖里,有两个阵营总是争论不休。一派信奉“大即是美”,认为数据越多越好;另一派坚守“小而精”,力挺质量胜于规 ...
2025-01-02数据分析是一个复杂且多维度的过程,从数据收集到分析结果应用,每一步都是对信息的提炼与升华。可视化分析结果,以图表的形式展 ...
2025-01-02在当今的数字化时代,数据分析师扮演着一个至关重要的角色。他们如同现代企业的“解密专家”,通过解析数据为企业提供决策支持。 ...
2025-01-02