作者: Cassie Kozyrkov
编译: Mika
本文为 CDA 数据分析师原创作品,转载需授权
> 关于作者:
Cassie Kozyrkov,Google首席决策师。致力于统计学, 机器学习 /人工智能、数据、决策科学。
数据科学是让数据变得有用的学科。在本文中我将对数据科学中的三个概念进行解读。
1. 定义数据科学
看到数据科学这个术语的早期历史,你会发现当时有两个概念是密不可分的。
· 大数据意味着要更多地利用计算机
· 统计学很难把纸上的算法通过计算机实现
因此,数据科学诞生了。最开始数据科学家的的定义是“能够编程的统计学家”。如今看来,这个说法并不准确,但首先让我们看到数据科学本身。
2003年的数据科学期刊中曾提出:"'数据科学'意味着任何与数据有关的内容。"我很同意这个观点,现在一切都离不开数据。
之后,我们看到了很多不同的观点,比如Conway的维恩图(下图),以及Mason和Wiggins的经典观点。
Drew Conway对数据科学的定义
我个人更喜欢维基百科上的定义:
数据科学一种"结合了统计、数据分析、机器学习及其相关方法的概念",以便用数据"理解和分析实际现象"。
这有些复杂了,让我们精简一下,即:
"数据科学是让数据有用的学科。"
你现在可能会想,但这也太精简了,“有用”这个词怎么能囊括所有这些术语呢?
那么让我们先看到下面的图。
统计学家和机器学习工程师之间的区别,并不是前者使用R语言而后者使用Python。由于许多原因,用SQL、R、Python进行分类是不明智的,如今你甚至可以用SQL进行机器学习。
新手还喜欢通过算法进行区分,许多大学课程也是这么安排的,这也是不明智的。最好不要用直方图、t检验以及神经网络进行分类。坦率地说,如果你很聪明,其实你可以用相同的算法解决任何数据科学问题。
我建议可以这样进行区分:
这指的是什么呢?当然是决定。你可以根据所需的事实,通过描述性分析得出决策。
我们的行动和决定会影响周围的世界。我们之前谈到要让数据变得有用,而这与现实世界的行动是紧密相关的。
以下是决策导向图,完成这三点能够让数据变得有用。
2. 数据挖掘
如果你不知道想做出什么样的决定,那么最好的做法就是去寻找灵感。这就称为数据挖掘、数据分析、描述性分析、探索性数据分析或(EDA)或知识发现(KD)。
分析的黄金法则:只对你所看到的做出结论。
你可以将数据集想象为在暗室中发现的一堆底片。数据挖掘就是让设备尽快曝光这些照片,看是否能从中得出启发。数据挖掘的黄金法则是:只能对你能看到的做出结论,不要对你看不到的内容做出判断,因为你需要统计数据等更多的专业知识。
数据挖掘的专业知识取决于检查数据的速度。一开始暗房会令人生畏,但其实也没什么大不了的,只是学会使用设备就行了。当你开始乐在其中时,你就可以称为数据分析师了;当你能够飞速地曝光照片时,你就可以称为分析师专家了。
3. 统计推断
灵感很容易获得,但严谨来之不易。如果你想重复利用数据,那么则需要专业的培训。作为本科和硕士都学统计学专业的人,我认为统计推断(简称统计)是三个领域中最难且最具哲学内涵的。想学好统计需要花费大量时间。
如果你打算做出高质量、风险可控的重要决策,那么你需要在分析团队中加入统计技能。在不确定的情况下,统计学是能改变你想法的学科。
4. 机器学习
机器学习实质上是使用例子而不是指令来实现操作。关于机器学习我曾写过一些文章,如关于机器学习与AI 的区别;如何入门机器学习等,如果感兴趣的话可以看看。
* The simplest explanation of machine learning you’ll ever read
https://hackernoon.com/the-simplest-explanation-of-machine-learning-youll-ever-read-bebc0700047c
* Are you using the term ‘AI’ incorrectly?
https://medium.com/@kozyrkov/are-you-using-the-term-ai-incorrectly-911ac23ab4f5
* Why businesses fail at machine learning
https://hackernoon.com/why-businesses-fail-at-machine-learning-fbff41c4d5db
5. 数据工程
那么数据工程是什么呢?数据工程指的是为数据科学团队提供数据的工作。数据工程本身就是一个复杂的领域,它更接近软件工程,而不是统计学。
数据工程和数据科学之间的差异是前后的区别。获取数据前的大部分技术工作都可以简单地称为“数据工程”,而得到数据后我们所做的一切都是“数据科学”。
6. 决策智能
决策智能是关于决策的,包括对根据大量数据进行决策,因此这也使其成为一个工程学科。它利用社会和管理科学的理念,增强数据科学的应用。
决策智能是社会和管理科学的组成部分。换而言之,它是数据科学的超集,而不涉及为通用用途创建基本方法之类的研究工作。
数据分析咨询请扫描二维码
数字化转型是企业提升竞争力和实现可持续发展的关键路径。面对快速变化的市场环境,以及技术的飞速发展,企业在数字化转型过程中 ...
2024-11-15CDA数据分析师认证:CDA认证分为三个等级:Level Ⅰ、Level Ⅱ和Level Ⅲ,每个等级的报考条件如下: Le ...
2024-11-14自学数据分析可能是一条充满挑战却又令人兴奋的道路。随着数据在现代社会中的重要性日益增长,掌握数据分析技能不仅能提升你的就 ...
2024-11-14数据分析相关职业选择 数据分析领域正在蓬勃发展,为各种专业背景的人才提供了丰富的职业机会。从初学者到有经验的专家,每个人 ...
2024-11-14数据挖掘与分析在金融行业的使用 在当今快速发展的金融行业中,数据挖掘与分析的应用愈发重要,成为驱动行业变革和提升竞争力的 ...
2024-11-14学习数据挖掘需要掌握哪些技能 数据挖掘是一个不断发展的领域,它结合了统计学、计算机科学和领域专业知识,旨在从数据中提取有 ...
2024-11-14统计学作为一门基于数据的学科,其广泛的应用领域和多样的职业选择,使得毕业生拥有丰厚的就业前景。无论是在政府还是企业,统计 ...
2024-11-14在当今高速发展的技术环境下,企业正在面临前所未有的机遇和挑战。数字化转型已成为企业保持竞争力和应对市场变化的必由之路。要 ...
2024-11-13爬虫技术在数据分析中扮演着至关重要的角色,其主要作用体现在以下几个方面: 数据收集:爬虫能够自动化地从互联网上抓取大量数 ...
2024-11-13在数据分析中,数据可视化是一种将复杂数据转化为图表、图形或其他可视形式的技术,旨在通过直观的方式帮助人们理解数据的含义与 ...
2024-11-13在现代银行业中,数字化用户行为分析已成为优化产品和服务、提升客户体验和提高业务效率的重要工具。通过全面的数据采集、深入的 ...
2024-11-13在这个数据飞速增长的时代,企业若想在竞争中占据优势,必须充分利用数据分析优化其营销策略。数据不仅有助于理解市场趋势,还可 ...
2024-11-13数据分析行业的就业趋势显示出多个积极的发展方向。随着大数据和人工智能技术的不断进步,数据分析在各行各业中的应用变得越来越 ...
2024-11-13市场数据分析是一门涉及多种技能和工具的学科,对企业在竞争激烈的市场中保持竞争力至关重要。通过数据分析,企业不仅可以了解当 ...
2024-11-13数据分析与数据挖掘是数据科学领域中两个关键的组成部分,它们各有独特的目标、方法和应用场景。尽管它们经常在实际应用中结合使 ...
2024-11-13在如今这个数据驱动的时代,数据分析能力已经成为许多行业的重要技能。无论是为工作需要,还是为了职业转型,掌握数据分析都能够 ...
2024-11-13在如今这个数据驱动的时代,数据分析能力已经成为许多行业的重要技能。无论是为工作需要,还是为了职业转型,掌握数据分析都能够 ...
2024-11-13作为一名业务分析师,你肩负着将业务需求转化为技术解决方案的重任。面试这一角色时,涉及的问题多种多样,涵盖技术技能、分析能 ...
2024-11-13自学数据分析可能看似一项艰巨的任务,尤其在开始时。但是,通过一些策略和方法,你可以系统地学习和掌握数据分析的相关知识和技 ...
2024-11-10Excel是数据分析领域中的一款强大工具,它凭借其灵活的功能和易用的界面,成为了许多数据分析师和从业者的首选。无论是简单的数 ...
2024-11-10