关于大数据的9个问题
“大数据”突然间变得无处不在,似乎每个人都想收集、分析大数据、并从中获利,同时也有人在夸耀或者害怕它的巨大影响。不论我们是在讨论利用谷歌庞大的搜索数据来预测流感的爆发还是利用通话记录来预测恐怖活动,又或者是利用航空公司的数据找到买机票的最佳时机,大数据都可以帮上忙。
将现代计算技术和数字时代众多的数据结合起来,似乎可以解决任何问题——犯罪,公共卫生,用语的变化,约会的危险,只要我们把这些数据利用起来。
似乎它的拥护者这样宣称。“在接下来的二十年,”记者帕特里克·塔克在他最近的大数据声明中这样写道,“是透明的未来,”“我们可以以一种前所未有的准确度预测未来的诸多领域,甚至包括一些长久以来被认为人类无法干预的领域。”但大数据其实从来没有听上去那么好。
大数据真的像说的那么好?毫无疑问大数据确实是一个有价值的工具,并在某些领域产生了至关重要的影响。比如,几乎近二十年人工智能计算机程序的成功,从谷歌的搜索引擎到IBM的沃森电脑问答系统,都包括了大量数据的处理。但是正是因为它最近如此受欢迎并得到广泛应用,我们需要清晰的看待大数据究竟能做什么和不能做什么。
首先,尽管大数据能够非常好地检测相关性,特别是那些用小数据集可能无法测出的微妙相关性,但是它并不会告诉我们哪一种相关性是有意义的。
比如,大数据分析可能会揭示从2006年到2011你那美国谋杀案比例与IE浏览器的市场份额是极度相关的,都呈急速下降趋势。但是很难相信这两者之间有什么因果关系。又比如,从1998到2007被诊断出的自闭症患者与有机食物的销售具有相关性(都呈急速上升趋势),但是这种相关性本身不会告诉我们饮食和自闭症的关系。
第二,大数据可以辅助科学调查,但不可能成功地完全代替。比如,分子生物学家很想从潜在的DNA序列中推断出蛋白质的三维结构,有一些科学家已经在用大数据来解决这个难题。但是没有任何科学家认为你可以完全依靠处理数据来解决这个难题,不论这个数据分析是多么的强有力,你依旧需要基于对物理和生物化学的理解上来处理这些数据。
第三,基于大数据的很多工具很容易造假。批改学生作文的大数据程序通常依赖于句子长度和用词的复杂性,数据表明这和老师批改的分数很相关。
但是一旦学生知道这个程序如何运作,他们就开始写一些长句子并用晦涩的词语而不是去学会如何规范清晰的表达,组成连贯的篇章。甚至谷歌的著名的搜索引擎,这个通常被认为成功的大数据案例也不能免于信息繁杂,无用的搜索结果,一些人为的原因使得一些搜索结果排在前面(搜索广告)。
第四,即便大数据的结果没有人为地造假,但是它看上去也不那么有效。比如谷歌预测流感的案例曾经是大数据的典范。2009年,谷歌通过相当大的宣传称它可以通过分析与流感相关的搜索预测流感爆发的趋势,这种准确性和快速甚至超过了疾病控制和预防中心等官方机构。但是几年后,谷歌宣称的流感预测并没有得到好的结果,最近两年,它做的更多地是不准的预测。
最近一篇《科学杂志》的文章解释道,谷歌流感预测的失败很大程度上是因为谷歌搜索引擎自己在不断的更新,这个时候收集的数据未必能够适用于下一个时候收集的数据。正如统计学家冯启思(《数据统治世界》的作者)所说的,依赖于网站的大数据收集常常把一些用不同方法、有不同目的数据整合起来,有时候这会产生负面的影响。从这样的数据样本得出结论是需要冒风险的。
第五个需要注意的就是“恶性循环”,这也是因为大量的数据都来自于网络。不论何时,大数据分析的信息源本身就是一种大数据产品,这很可能会导致恶性循环。
谷歌翻译等翻译程序是从不同语言中抽取相似的文本去辨别这些语言的翻译模式,比如同样的维基百科条目有两种语言。这是一个很合理的策略,要不是有很多语言并不具有太多相似性,维基百科自己都可以用谷歌翻译写条目。在这种情况下,任何谷歌翻译的错误都会影响维基百科,而这又会反映到谷歌翻译上,使这种错误不断加强。
第六个需要担心的就是太多相关性导致的危险。如果你在两个变量中不断地寻找相关性,那么你很可能会纯粹出于偶然发现虚假的相关性,即便在这些变量中并没有实际意义的联系。缺乏谨慎的检查,大数据的量级会扩大这些错误。
第七,大数据很容易对那些无法精确的问题给出听上去很科学的解释。比如在过去几个月,基于维基百科的数据给人们排名有两个不同的尝试:根据历史重要性或者文化贡献。其中一本书叫做《谁更强?历史人物真实的排名在哪里》,作者是电脑工程师Steven Skiena 和工程师Charles Ward,另一本叫做《万神殿》,来自于麻省理工学院媒体实验室项目。
这些尝试在某些方面是正确的,耶稣、林肯、莎士比亚确实是极为重要的人物,但是两者都犯了一些严重的错误。《谁更强?》指出法兰西斯.史考特.凯伊(Francis Scott Key )在历史上是19世纪最重要的作家,远远超过简·奥斯汀(第78名)和乔治·爱略特(第380名)。更严重的是,两本书呈现出了利用所谓的精确误导人,而在本质上是模糊升值无意义的。大数据可以把任何事都简化为数字,但是你不应该被这些“科学”的表现愚弄。
最后,大数据在分析那些普通事件很在行,但是在分析罕见事件常失败。比如,用大数据处理文本的程序如搜索引擎和翻译程序,常常依赖于所谓的“三字”:连续三个词的序列(比如“in a row”)。可靠的数据信息可以编制常规的三字模型,正是因为他们常出现,但是现有的数据并没有多到足够包括人们可能使用的所有“三字”,因为人们在不断创造新语言。
随便挑一个例子,Rob Lowe 最近为报纸写的书评有九个“三词序列”比如“dumbed-down escapist fare”,这在谷歌的文本里从未出现过。对于这些新鲜词汇谷歌有很多限制,谷歌将“dumbed-down escapist fare”西安翻译为德文然后再翻译为英文,最后出现了这样一个不合逻辑的词语“scaled-flight fare.”Lowe先生的本意和利用大数据的翻译真是完全不搭边。
等等,我们几乎忽略了最后一个问题:炒作。大数据的支持者宣称它是革命性的进步。但是即便是给出大数据的成功例子,比如谷歌流感趋势的预测,即便有用但对于一些更大的事这些显得微不足道。相比19世纪和20世纪的伟大发明比如抗生素,汽车,飞机,大数据所得出的东西实在算不了什么。
我们需要大数据,毫无疑问。但是我们也需要更加清醒的认识到,这只是一种每个人都可以分析的重要资源,并不是什么新技术。
数据分析咨询请扫描二维码
《Python数据分析极简入门》 第2节 2 Pandas数据类型 Pandas 有两种自己独有的基本数据结构。需要注意的是,它固然有着两种数据 ...
2024-11-01《Python数据分析极简入门》 第2节 1 Pandas简介 说好开始学Python,怎么到了Pandas? 前面说过,既然定义为极简入门,我们只抓 ...
2024-10-31在当今数据驱动的世界中,数据科学与工程专业的重要性愈发凸显。无论是推动技术进步,还是在商业决策中提供精准分析,这一专业都 ...
2024-10-30在当今信息爆炸的时代,数据已成为企业决策和战略制定的核心资源。爬虫工程师因此成为数据获取和挖掘的关键角色。本文将详细介绍 ...
2024-10-30在当今数据驱动的世界中,数据分析是揭示商业洞察和推动决策的核心力量。选择合适的数据分析工具对于数据专业人士而言至关重要。 ...
2024-10-30能源企业在全球经济和环境保护双重压力下,正面临前所未有的挑战与机遇。数字化转型作为应对这些挑战的关键手段,正在深刻变革传 ...
2024-10-30近年来,随着数据科学的逐步发展,Python语言的使用率也越来越高,不仅可以做数据处理,网页开发,更是数据科学、机器学习、深度 ...
2024-10-30大数据分析师证书 针对不同知识,掌握程度的要求分为【领会】、【熟知】、【应用】三个级别,考生应按照不同知识要求进行学习。 ...
2024-10-30《Python数据分析极简入门》 附:Anaconda安装教程 注:分Windows系统下安装和MacOS系统安装 1. Windows系统下安装 第一步清华大 ...
2024-10-29拥抱数据分析的世界 - 成为一名数据分析工程师是一个充满挑战和机遇的职业选择。要成功地进入这个领域,你需要掌握一系列关键技 ...
2024-10-28降本增效:管理战略的关键 企业管理中的降本增效不仅是一项重要的战略举措,更是激发竞争力、提高盈利能力的关键。这一理念在当 ...
2024-10-28企业数字化是指利用数字技术和信息化手段,对企业的各个方面进行改造和优化,以提升生产效率、服务质量和市场竞争力的过程。实现 ...
2024-10-28数据科学专业毕业后,毕业生可以选择从事多种不同的岗位和领域。数据科学是一个快速发展且广泛应用的领域,毕业生在企业、学术界 ...
2024-10-28学习数据科学与大数据技术是当今职业发展中至关重要的一环。从基础到高级,以下是一些建议的课程路径: 基础课程: Python编程 ...
2024-10-28在信息技术和数据科学领域,数据架构师扮演着至关重要的角色。他们负责设计和管理企业中复杂的数据基础设施,以支持数据驱动的决 ...
2024-10-28进入21世纪以来,随着信息技术的迅猛发展,大数据已经成为全球最具影响力的技术之一,并成为企业数字化转型的核心驱动力。大数据 ...
2024-10-28随着科技的迅猛发展,数字化转型已成为现代企业保持竞争力和推动增长的关键战略之一。数字化不仅仅是技术的应用,它代表着一种全 ...
2024-10-28银行业正处于一个前所未有的数字化转型时期。在数字经济的驱动下,金融科技如大数据、人工智能、生物识别、物联网和云计算等技术 ...
2024-10-28数据分析可视化是一门艺术与科学相结合的技术,其主要目标是将复杂的数据变得更易于理解和分析。通过将数据以图表的形式呈现,我 ...
2024-10-28数据分析师在现代信息密集型的商业世界中扮演着至关重要的角色。他们通过专业的技能和敏锐的商业洞察力,帮助企业从大量数据中提 ...
2024-10-28