大数据帮你洗脑:你是如何混淆因果关系的
这是一个人人都谈大数据的时代,不过数据真的是有益的吗?其实不一定,数据经常也会忽悠人。
请一句话评价下列事件(假设数据是真实的):
研究发现,越是成功人士,睡眠时间越短。
研究发现,女人结婚后变得更加贫穷,男人结婚后变得更加富有。
研究发现,越富有的人越幸福。
研究发现,儿童时期吃西兰花越多,成年后往往职业收入越多。
研究发现,去医院越多,越容易生病。
过去20多年跟踪研究发现,中国GDP越高,90后一代身高越高。
……
根据本人潜水博客论坛观察总结,大部分人的评价是这样的(至少前3个事件的评价是这样):
1,研究发现,越是成功人士,睡眠时间越短。
这么说,我要是不睡觉,是不是薪水就上亿了?
2,研究发现,女人结婚后变得更加贫穷,男人结婚后变得更加富有。
看来还是女人对婚姻牺牲大啊!结婚导致女人收入变低,却增加了男人收入。
3,研究发现,越富有的人越幸福。
屌丝们洗洗睡吧,你幻想的穷开心是不现实的。
4,研究发现,儿童时期吃西兰花越多,成年后往往职业收入越多。
我勒个去,都怪我小时候西兰花吃少了,大白菜吃多了!
5,研究发现,去医院越多,越容易生病。
唉,以后生病还是别去医院了。
6,过去20多年跟踪研究发现,中国GDP越高,90后一代身高越高。
哇!原来提高GDP还有这好处!不过,如果将来中国GDP下降,下一代怎么办?
等等,貌似这上面的逻辑有点问题吧?
实际上,上面的每一个推理都有严重的逻辑错误,都是错把相关关系当做了因果关系:
A越多,B越多,这是相关关系。
A越多,导致B越多,这是因果关系。
而如果没有进一步的调查和理论,相关关系是推理不出因果关系的。
为什么?
请看下面这个“脑筋急转弯”:
猜猜,下图的鸡和蛋是什么关系?
直觉:母鸡刚刚下了蛋。
第二直觉:还有可能是这个母鸡是由这个鸡蛋孵化出来的。
其实,它们有4种可能的关系:
同样,两个“A越多,B越多”这样的相关性实际上有4种可能(以收入和睡眠的为例):
A导致B:更少睡眠导致收入增加。
B导致A:收入增加导致睡眠减少。
A和B同时被C导致:随着年龄的增长,人对睡眠要求减少,因此睡眠少。同时年龄大的人,往往经验、人脉、知识更多,也自然收入更多。
A和B没有任何关系: 美国、西欧等经济发达,导致人们收入高;同时他们爱吃牛排,导致睡眠需求减少。(数据仅为举例,不代表真有这样的关系。)
所以,当你看到“睡眠越少,收入越多”这样的统计结果后,不要天真地认为只要你减少睡眠,你也能收入变高。
当然生活中的确有人是这么做的:
我认识一个人,看到了这样一个微博上流行的统计结果后,为了获得成功而刻意减少睡眠。
甚至,当他凌晨2点还在玩DOTA时,你过去问他:“你怎么还不睡?”他的回答是:“睡眠越少,将来越成功!为了赚大钱,我先从减少睡眠开始。而在这漆黑的夜里,只有DOTA能让我清醒。”
所以,假设“成功导致睡眠少”而不是“睡眠少导致成功”,你是无法通过减少睡眠而变得更加成功的。就像白种人喜欢吃牛排,但是你无法通过吃牛排变得更白。
除了“成功VS睡眠”之外,其实上面每个新闻都有类似的逻辑错误:
研究发现,女人结婚后变得更加贫穷,男人结婚后变得更加富有。
这个数据其实无法推测出结婚让女人变穷男人变富,还有可能是:预期自己将来没什么钱赚的女人更想赶紧把自己嫁出去,而预期将来能赚很多钱的男人倾向于赶紧找个老婆。
当然,还有可能是其他原因甚至是完全无关的因素造成了这个相关关系。
研究发现,越富有的人越幸福。
通过这个数据并不能推测出你赚钱后就能变得更加富有。
实际上研究证明,当金钱超过个人基本需求之后(比如已经吃饱穿暖),对长期幸福感没有显著影响。
比如中了巨额彩票的人得到的幸福感只是短期的(类似吸毒产生的幸福感),调查发现,中彩票后6个月,即使你变得比之前富有上百倍,但是你的幸福感指数还是维持在6个月前水平。
(此研究详细请看哈佛大学公开课《幸福课》,by Tal-Ben Sharhar)
那么为什么我们发现富有的人往往很幸福呢?
其实这是因为富有和长期幸福都由类似的因素导致:自信、热忱、勤奋等。所以,你的自信、热忱、勤奋等情商特征有2个产物:
能够提升你长期幸福感,让你觉得生活更加有意义
能够让你赚钱升职。但这不代表赚钱本身可以提高长期幸福感。
所以,“穷开心”还是存在的。
研究发现,儿童时期吃西兰花越多,成年后往往职业收入越多。
这个新闻是我YY的,但是这句话绝对的正确的!
数据分析咨询请扫描二维码
统计学基础 - 理解统计学的基本概念和方法是数据分析师必备的技能之一。统计学为他们提供了处理数据、进行推断和建模的基础。 数 ...
2024-11-25数据分析师在如今信息爆炸的时代扮演着至关重要的角色。他们不仅需要具备扎实的数据分析技能,还需要不断学习和适应不断发展的技 ...
2024-11-25数据分析师的工作职责涉及多个关键方面,从数据的获取到处理、分析再到可视化,旨在为企业的决策提供有力支持。让我们深入了解数 ...
2024-11-25数据分析师:洞察力量的引擎 数据分析师的兴起 数据分析师行业目前正处于快速发展阶段,市场需求持续增长,薪资水平也有所提升。 ...
2024-11-25数据收集与整理 - 从各种来源收集数据,清洗和整理以确保数据质量和可用性。 数据分析与建模 - 运用统计学方法和机器学习模型对 ...
2024-11-25数据分析是当今社会中不可或缺的一项技能,涵盖了广泛的工具和技术。其中,掌握各种数据处理函数对于数据分析师至关重要。本文将 ...
2024-11-25“大数据治理”是一个涵盖广泛的复杂概念,其核心在于确保大规模、多样化的数据资源能够被有效管理和利用。不仅涉及数据的采集、 ...
2024-11-25一、引言 背景介绍 随着信息技术的快速发展和互联网的普及,大数据已经成为现代社会的重要资产。大数据的兴起不仅推动了各行各业 ...
2024-11-25《Python数据分析极简入门》 第2节 7 Pandas分组聚合 分组聚合(group by)顾名思义就是分2步: 先分组:根据某列数据的值进行 ...
2024-11-25数据分析需要学习的内容非常广泛,涵盖了从理论知识到实际技能的多个方面。以下是数据分析所需学习的主要内容: 数学和统计学 ...
2024-11-24数据分析师需要具备一系列多方面的技能和能力,以应对复杂的数据分析任务和业务需求。以下是数据分析师所需的主要能力: 统计 ...
2024-11-24数据分析师需要学习的课程内容非常广泛,涵盖了从基础理论到实际应用的多个方面。以下是根据我搜索到的资料整理出的数据分析师需 ...
2024-11-24《Python数据分析极简入门》 第2节 6 Pandas合并连接 在pandas中,有多种方法可以合并和拼接数据。常见的方法包括append()、conc ...
2024-11-24《Python数据分析极简入门》 第2节 5 Pandas数学计算 importpandasaspdd=np.array([[81,&n ...
2024-11-23数据分析涉及多个方面的学习,包括理论知识和实践技能。以下是数据分析需要学习的主要方面: 基础知识: 数据分析的基本概念 ...
2024-11-22数据分析适合在多个单位工作,包括但不限于以下领域: 金融行业:金融行业对数据分析人才的需求非常大,数据分析师可以从事经 ...
2024-11-22数据分析是一种涉及从大量数据中提取有用信息和洞察力的过程。其工作内容主要包括以下几个方面: 数据收集与整理:数据分析师 ...
2024-11-22数据分析师需要掌握多种技能,以确保能够有效地处理和分析数据,并为业务决策提供支持。以下是数据分析师需要掌握的主要技能: ...
2024-11-22数据开发和数据分析是两个密切相关但又有所区别的领域。以下是它们的主要区别: 定义和目标: 数据开发:数据开发涉及数据的 ...
2024-11-22数据架构师是负责设计和管理企业数据架构的关键角色,其职责涵盖了多个方面,包括数据治理、数据模型设计、数据仓库构建、数据安 ...
2024-11-22