五个例子教会你辨真伪数据图表中的陷阱
这一年来,Quartz制作了众多图表,也花了不少时间思考、讨论相关问题,发布了长达6000字的数据处理指南(深度君将会奉上中文版精华)以及一篇讲解如何正确使用y轴的文章。看到很多图表要么使用模糊或错误的数据、画出有偏差的轴线,要么在其他方面误导读者,我们觉得很可惜。我们"数据分析师"会想,“世界到处都是优质的数据呀!为什么每个人不能合理引用数据、使之标准化,直接把它展现出来呢?”因此,Quartz今年总结出错误最突出的例子,加以纠正。
1. y轴不出现,大小难以辨
——以Planned Parenthood数据中y轴的偏差为例
在2015年9月29日举行的一场听证会上,美国参议院中的共和党议员不断追问非营利组织Planned Parenthood(该组织是一个提供计划生育相关服务的非营利组织,大约每年接待 270万女性进行各种身体检查,避孕与堕胎等。来源:知乎)的主席Cecile Richards,指责她滥用了该组织的年度联邦资助中的500万美元。为了阐明问题,犹他州的参议员Jason Chaffetz以下图佐证:
他解释道:“粉色轴线告诉我们该组织所做的乳房检查次数在不断减少,红色轴线则显示堕胎手术实施次数逐渐上升。这反映了该组织的现状。”
乍一看,这张图的确显示Planned Parenthood实施的堕胎手术数量猛增,同时癌症检查的次数却急剧下降。读者还可能被误导,认为从2010年起该组织实施的堕胎次数远远多于预防检查次数。但这并非实情。这张图最大的错误在于没有明显的y轴,因而两条数据线随意交叉,让人误以为327000比935573还要大呢。
美国事实核查型新闻网站Politifact "数据分析师"核对了以上数据,从Planned Parenthood年度报告中选取了堕胎手术和预防性措施的数据。数据范围调整合理后,信息展现如下:
如图所示,癌症检查和预防服务的数量的确呈下降趋势,这和原图表相一致。但这些检查的次数仍远远大于堕胎手术次数。下图采用了另一种展现方式,用的是这两项服务逐年的百分比变化:
(注意:本图并未收录2008年的数据;Politifact和Quartz均未找到该年的报告)
2.图形元素不可用,双重标准有漏洞
——以美国白宫错误计算高中毕业率为例
在12月中旬,美国白宫的官方账号发了一条推特:“好消息:美国高中毕业率已升至历史最高水平。”推特配图如下:
此图有好几个问题值得商榷。首先,"数据分析师"在数据图里用图形元素作单位从来都不是个好主意。用五本书代表75%、或者用16本书代表82%是几个意思?这到底是个柱状图,y轴就应该以零作为起始值。同样的数据,采用合适的比例后呈现如下:
其实毕业率的逐年变化没有原图那么大,对吧?但问题不止于此。仔细看看白宫这张图右下角“数据来源”一行:毕业率数据来自“美国教育部(DOE)下属的国家教育统计中心(NCES)”。问题在于,无论是统计中心还是教育部都无法提供一张囊括2008年至2014年逐年毕业率的单一数据表。不同的数据集合可能采用不同方法计算毕业率,把这些数据放在一起讨论是有潜在问题的。这也说明政府的数据分类做的太糟糕,即使是毕业率这样简单的指标他们也需要好几张数据表才拼凑得出。
现在,我们暂且假定白宫的核算方法没问题,选取的数据表都采用了同样的方法计算毕业生组别,但有一个问题我们不能忽视:即使y轴固定,柱状图也可能是一种糟糕的呈现方式。要知道,制图时最重要的是选择合适的方式呈现数据。若要显示一段时间内毕业率的细微差别,最好用折线图。以下数据图便采用了单一数据源,囊括了1975年以来每年的毕业率:
若纵观全局,我们能得出几个结论。一是毕业率在奥巴马甫任总统时就已经呈现上扬趋势。另一个是,截至2012年,奥巴马任期内毕业率的增长百分比已经超过了以往任何一届总统。如果像白宫图表显示的那样,2014年的毕业率为82%,该增长幅度实际接近于7%。 (*更新:我们之前将统计中心和教育部分为“两个单独的数据来源”。一些读者指出统计中心是教育内部机构,因此应该被视为同一数据来源。我们表示赞同,对以上内容做了相应修改。)
3. y轴起始都是零,细微变化看不清
以National Review杂志全球变暖的报道为例 下面这张图可谓是2015全球(图片界)最差图表:
当有人"数据分析师"说所有折线图的y轴都应该以0为起始点时,我们都应该想想这张图。全球平均气温即使仅仅变化了1度,也会影响巨大,但这张图从零开始计数,气温的变化就显得微乎其微了。正如记者David Yanofsky在他的文章《y轴不以零起始也完全可以》里所说,当你画出口腔温度变化图,y轴从零开始计,就会变成下图这样:
下面这份同样看不出变化的逐年对比图则是由彭博商业周刊图片部发布的:
实际上,要想准确呈现1880年以来全球平均气温的变化,我们得把y轴的起始数据调高:
4.背景不了解,制图出偏颇
——以美国政府开支分布图为例
以下是2015年初疯传的政府开支饼图:
Politifact发现,这是一个对于政府开支实际运作方式根本上的误读。该图展现的仅仅是政府可以自由决定的部分,完全忽略了硬性开支。实际上,医疗保健、医疗补助、社会保障等法定项目占去了政府总开支的60%。该图显示政府给低收入者发放的“食品券”一项已被归入食品和农村预算一项(可由政府自由决定),实际上是硬性项目的一部分,并没有在图中体现出来。以下则是包括硬性开支后的2015年政府开支图:
据Politifact称,图中的“其余开支”一项包括“司法部门、立法部门、独立机构和商务部、内政部、财政部除去抵消性收入后的开支”。
5.数据来源不统一,标准混乱失公允
——以美国总统任期内大规模枪击案数量图为例
加州圣伯纳迪诺市发生枪击后,对于如何计算划分大规模枪击的讨论在数据界展开。相关的数据收集有好几种,定义的方法也各不相同。有些只计算了造成四人及以上死亡的枪击案例,其他的则将四人及以上中枪(无论死伤)的案例都算在内。问题在于,根据不同标准,每年大规模枪击的数量范围可从几十跨到上百。
在12月2日,一家名为Truthstream Media的网站发布了一篇文章,题目为“为什么奥巴马任内发生的大规模枪击超过了他前四任的总和?”报道插入下图作为证明,据称参考多个数据源。一是Mother Jones数据库计算的大规模枪击数量,使用的就是四人及以上死亡的标准。其他两个数据源来自维基百科。
经过检查,我们"数据分析师"发现这些数据都是有意筛选过的,奥巴马任期的数字被歪曲了。
TruthStreamMedia.com对于“大规模枪击案”的定义范围限定宽松,捏造了不失数据。奥巴马任期内的枪击案还算上了家庭谋杀案,而计算前四任时却把这一项省去了。例如,奥巴马任期内的统计中出现了“Ervin Lupoe枪击案”的记录。Lupoe在2009年杀死了自己的妻子和五个孩子,但是维基百科或Mother Jones数据库并没有收录该案件,因为它不属于“大规模枪击”一类。 以下为以总统任期为单位的大规模枪击案数量统计图,使用的是Mother Jones的数据:
数据分析咨询请扫描二维码
《Python数据分析极简入门》 第2节 4 Pandas条件查询 在pandas中,可以使用条件筛选来选择满足特定条件的数据 importpanda ...
2024-11-22数据分析师的工作内容涉及多个方面,主要包括数据的收集、整理、分析和可视化,以支持商业决策和问题解决。以下是数据分析师的一 ...
2024-11-21数据分析师必须掌握的技能可以从多个方面进行归纳和总结。以下是数据分析师需要具备的主要技能: 统计学基础:数据分析师需要 ...
2024-11-21数据分析入门的难易程度因人而异,总体来看,入门并不算特别困难,但需要一定的学习和实践积累。 入门难度:数据分析入门相对 ...
2024-11-21数据分析是一项通过收集、整理和解释数据来发现有用信息的过程,它在现代社会中具有广泛的应用和重要性。数据分析能够帮助人们更 ...
2024-11-21数据分析行业正在迅速发展,随着技术的不断进步和数据量的爆炸式增长,企业对数据分析人才的需求也与日俱增。本文将探讨数据分析 ...
2024-11-21数据分析的常用方法包括多种技术,每种方法都有其特定的应用场景和优势。以下是几种常见的数据分析方法: 对比分析法:通过比 ...
2024-11-21企业数字化转型是指企业利用数字技术对其业务进行改造和升级,以实现提高效率、降低成本、创新业务模式等目标的过程。这一过程不 ...
2024-11-21数据分析作为一个备受追捧的职业领域,吸引着越来越多的女性加入其中。对于女生而言,在选择成为一名数据分析师时,行业选择至关 ...
2024-11-21大数据技术专业主要学习计算机科学、数学、统计学和信息技术等领域的基础理论和技能,旨在培养具备大数据处理、分析和应用能力的 ...
2024-11-21《Python数据分析极简入门》 第2节 3 Pandas数据查看 这里我们创建一个DataFrame命名为df: importnumpyasnpi ...
2024-11-21越老越吃香的行业主要集中在需要长时间经验积累和专业知识的领域。这些行业通常知识更新换代较慢,因此随着年龄的增长,从业者能 ...
2024-11-20数据导入 使用pandas库的read_csv()函数读取CSV文件或使用read_excel()函数读取Excel文件。 支持处理不同格式数据,可指定分隔 ...
2024-11-20大数据与会计专业是一门结合了大数据分析技术和会计财务理论知识的新型复合型学科,旨在培养能够适应现代会计业务新特征的高层次 ...
2024-11-20要成为一名数据分析师,需要掌握一系列硬技能和软技能。以下是成为数据分析师所需的关键技能: 统计学基础 理解基本的统计概念 ...
2024-11-20是的,Python可以用于数据分析。Python在数据分析领域非常流行,因为它拥有丰富的库和工具,能够高效地处理从数据清洗到可视化的 ...
2024-11-20在这个数据驱动的时代,数据分析师的角色变得愈发不可或缺。他们承担着帮助企业从数据中提取有价值信息的责任,而这些信息可以大 ...
2024-11-20数据分析作为现代信息时代的支柱之一,已经成为各行业不可或缺的工具。无论是在商业、科研还是日常决策中,数据分析都扮演着至关 ...
2024-11-20数字化转型已成为当今商业世界的热点话题。它不仅代表着技术的提升,还涉及企业业务流程、组织结构和文化的深层次变革。理解数字 ...
2024-11-20在现代社会的快速变迁中,选择一个具有长期增长潜力的行业显得至关重要。了解未来发展前景好的行业不仅能帮助我们进行职业选择, ...
2024-11-20