7月9日,美国《连线》杂志近日刊登了一篇关于大数据的评论文章。在短短的几十年里,“技术天才”与社会的关系已经改变:他们从关在屋里的孤独者变成救世主,从反社会者变成社会的最大希望。许多人现在似乎相信,理解我们这个世界的最佳方式,就是坐在电脑屏幕前分析我们称之为“大数据”的海量信息。而作者认为,如果缺乏对人们现实生活的实地调查,大数据没有什么意义。
什么样的大数据有意义?除了大数据之外,你还要走出去观察和了解这个世界
关于这一点,我们只要看看 “谷歌流感趋势(Google Flu Trends)”。2008年,当谷歌推出这项服务时,硅谷的许多人将它鼓吹为表明大数据将很快淘汰传统分析方式的一个标志性产品。
“谷歌流感趋势”不仅没有提供流感传播的精确描述,也无法实现大数据鼓吹者的美梦。这是因为,如果没有“厚数据”(丰富的、具有前后关联性的数据,它们只能通过丢开电脑、深入实际生活才能获得),大数据就没有意义。电脑极客们曾经因为不能适应社会生活而被嘲笑,他们被告知应该“多出去走走”。实际上,如果大数据的信徒们希望理解这个他们也在参与塑造的世界,他们真的需要多出去走走。
“谷歌流感趋势”的目的是:找出人们在流感季节常用的搜索词,然后实时跟踪这些搜索词的使用高峰期。这样,谷歌就可以在新流感爆发之前发出警报,而且预警时间要比官方疾病防治中心的预警时间早大约两周。
对很多人来说,“谷歌流感趋势”已经成为大数据的一个典型代表,它表现了大数据的巨大力量。在畅销书《大数据:一场改变生活、工作和思考方式的革命》(A Revolution That Will Transform How We Live, Work and Think)中,作者维克托?迈尔?舍恩柏格(Viktor Mayer-Sch?nberger)和肯尼斯?库克耶(Kenneth Cukier)宣称,与政府滞后的数据相比,“谷歌流感趋势”是更有用、更及时的流感指示器。
然而,著名的《科学》杂志本月刊登一篇文章告诉我们,自2011年8月以来,“谷歌流感趋势”几乎每周都会高估流感的盛行率。
而在2009年,就在“谷歌流感趋势”推出后不久,它竟然完全没有察觉猪流感的爆发。事实上,人们在流感季节的许多常用搜索词与流感无关,而与流感的通常爆发季节——冬季——密切相关。
许多人争论道,“谷歌流感趋势”的失败缘于大数据的不成熟。这种观点没有切中要害。当然,调整算法、提高数据收集技术将会让下一代大数据工具变得更有效。然而,大数据鼓吹者真正的狂妄之处不在于对一套不成熟的算法过于自信,而在于盲目地相信坐在电脑屏幕前捣鼓一些数字就可以充分理解世界。
大数据仅仅是大量的“薄数据”,它们是通过对人们的活动和行为进行跟踪而获得的。我们最常去的地方,我们在网上搜索的东西,我们每天睡了多久,我们有多少联系人,我们所听的音乐类型等等。这些数据是通过你浏览器中的“cookies”、你戴在手上的FitBit腕带或你手机上的GPS来收集的。这些信息无疑是重要的,但我们不能通过它们来获得对人的完整理解。
为了真正地了解人,我们不久需要大数据,而且需要厚数据。厚数据不仅包括事实,而且包括事实的前后联系。比如说,美国有86%的家庭每周会喝掉6夸脱以上的牛奶,但是她们为什么喝牛奶?他们是怎么喝的?一块包含三种颜色、绣着星星和条纹图案的布,这是薄数据;一面在风中飘扬的美国国旗,这是厚数据。
基于“我们做了什么”,大数据对我们进行简单化的理解;厚数据则试图通过我们与周围世界的联系来理解我们。只有理解人与周围世界的联系,人们才能从整体上认识这个世界,这恰恰也是谷歌、facebook等公司想要做的。
想想硅谷的那些宏伟宣言。谷歌的宗旨是“组织全球信息,使人人皆可访问它们并从中获益。”马克·扎克伯格(Mark Zuckerberg)最近对投资者表示,在全球化和知识经济日益受到重视的当今世界,Facebook致力于一个新的使命:“理解这个世界”。他说:“人们每天在Facebook上发布数十亿条内容和链接。在他们的帮助下,我们通过专门的算法机制为世界上所有事物建立最清晰的模型。”甚至有一些小公司也参与了“理解这个世界”。去年,Jawbone公司的副总裁耶利米?罗宾逊(Jeremiah Robison)说,他们的健康跟踪设备Jawbone UP的目标是“理解(人的)行为变化的科学。”
这些目标的确很大。企业渴望更好地理解社会,这不足为怪。毕竟,了解与客户行为及社会文化相关的信息,这对企业经营来说是必不可少的。而且,在知识经济时代,这些信息本身已经成为一种通货,它们可以换来点击率、浏览量和广告收入。或者更简单地说,它们可以换来权力。在这个过程中,如果谷歌、facebook等公司能不断帮助我们增进对自身的集体知识,它们获得更多权力也是正当的。问题在于,如果它们声称计算机能够组织我们的所有数据,或能够向我们提供关于流感、健康或社会关系等各方面的完整理解,那么,它们从根本上小看了“数据”和“理解”的意义。
如果硅谷的大数据鼓吹者真想“了解世界”,那么他们不仅需要掌握大数据,也需要掌握厚数据。不幸的是,要获得后者,他们需要丢开电脑去实地体验这个世界,而不是仅仅通过谷歌眼镜(或通过facebook的虚拟现实设备)来观察世界。
如果你对一个领域高度熟悉,有能力填补信息空白并想象人们的行为原因,那么“薄数据”将是有用的。换句话说,如果你能够想象并重建人们的行为的发生情境,你所观察到的行为才是有意义的。如果缺乏对行为情境的了解,就不可能推出任何因果关系,也不可能理解人们的行为原因。
这就是为什么研究人员在科学实验中要竭尽全力控制实验室的环境,以创造一个各种影响因素都被考虑在内、彻底的人工场所。不过,真实世界并不是一个实验室。要确保你对陌生世界的情境有所了解,唯一的途径是实地观察并内化和解释正在发生的每一件事。
如果说大数据擅长观察人们的行为,那么它不擅长的就是理解人们对每样事物的背景知识。我是怎么知道每次刷牙时该用多少牙膏的?我是怎么知道何时该进入另一个交通通道的?眨眼是表示“真有趣”还是“我的眼睛进了东西”?这些都涉及人们的内在能力、无意识和背景知识,它们控制着人们的大多数行为。跟周围的事物一样,这些不可见的背景知识只有在观察者主动去看的情况下才能被发现。不过,它们却对每个人的行为有着重要影响。它能够解释事物与人的联系,以及事物对人的意义。
没有哪一个单独的工具能够成为理解人类的超级武器。尽管硅谷有许多出色的发明,不过我们对任何数字技术的期望都应该有个限度。“谷歌流感趋势”真正教给我们的是:不能仅仅问这些数据有多“大”,还要问这些数据有多“厚”。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
“最近复购率一直在下降,我们的营销力度不小啊,为什么用户还是走了?” “是不是广告投放的用户质量不高?还是我们的产品问题 ...
2025-02-21以下文章来源于数有道 ,作者数据星爷 SQL查询是数据分析工作的基础,也是CDA数据分析师一级的核心考点,人工智能时代,AI能为 ...
2025-02-19在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-18当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-17近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的, ...
2025-02-14一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05在数据分析的世界里,“对比”是一种简单且有效的方法。这就像两个女孩子穿同一款式的衣服,效果不一样。 很多人都听过“货比三 ...
2025-02-05当我们只有非常少量的已标记数据,同时有大量未标记数据点时,可以使用半监督学习算法来处理。在sklearn中,基于图算法的半监督 ...
2025-02-05考虑一种棘手的情况:训练数据中大部分样本没有标签。此时,我们可以考虑使用半监督学习方法来处理。半监督学习能够利用这些额 ...
2025-02-04一、数学函数 1、取整 =INT(数字) 2、求余数 =MOD(除数,被除数) 3、四舍五入 =ROUND(数字,保留小数位数) 4、取绝对值 =AB ...
2025-02-03作者:CDA持证人 余治国 一般各平台出薪资报告,都会哀嚎遍野。举个例子,去年某招聘平台发布《中国女性职场现状调查报告》, ...
2025-02-02真正的数据分析大神是什么样的呢?有人认为他们能轻松驾驭各种分析工具,能够从海量数据中找到潜在关联,或者一眼识别报告中的数 ...
2025-02-01现今社会,“转行”似乎成无数职场人无法回避的话题。但行业就像座围城:外行人看光鲜,内行人看心酸。数据分析这个行业,近几年 ...
2025-01-31