采集和分析大数据时所面临的问题
你或许很熟悉这样一个统计结论:世界90%的数据是过去几年里产生的。事实上,过去三十年中,全世界的数据量大约每两年增加10倍——远远超过了计算机领域的摩尔定律。
这样的信息增长速率会带来一些问题,其中之一便是现时的数据量总是远远超过即使最近的过去。想象你正在通过一本相片簿回顾人生的头18年,假设在两岁时你有两张照片,如果信息增长速率与世界数据量相同,那么在你6到8岁时,你会有惊人的2000张照片;10到12岁时有20万张照片;而在16到18岁时,照片数量会达到2亿张,相当于在最后两年中,每秒有3张以上的照片。
当然,这并非是全球数据增长情况的完美类比。首先,世界大部分数据的增长源于有更多的人创造出了更多的信息来源,同时伴随更大、更精细的格式。不过,有关比例的观点还是成立的。如果你像前述的例子那样回顾以往的记录,或者试图进行分析,那距离越久远的过去就会变得越无关紧要。
这就是目前采集和分析大数据时所面临的问题。当你开始以更长远的视角往前回溯时,会发现近期的事情太多,而以前的事情太少。短视是结构性的,对短期趋势的过度估计是压倒性的,同时却忽略了历史的经验教训。
为了理解这个问题的重要性,需要考虑社会科学中有关“近期偏差”(recency bias,又称近因效应)的研究发现。近期偏差是指在判断趋势时,认为未来事件与近期体验更加类似。这可以说是某种“可利用性法则”(availability heuristic) ——不恰当地以最容易被知觉到的信息来作为思考的基础。这还是一种普遍的心理学特征。举例来说,如果在你居住的地方,过去几年中夏季都异乎寻常地寒冷,你 可能会认为夏天正在变得更冷——或者说你当地的气候正在变冷。事实上,你不应当把任何东西都塞到数据里分析。你需要有一个长远的视角,才能认识真正有意义的气候趋势。在短时期内,你最好不进行任何猜测。不过,我们之中又有谁能真正做到这点呢?
现实生活中大部分复杂的趋势正是如此:股票市场、经济发展、企业的成功或失败、战争或和平、国家关系、帝国的崛起和衰落等等。短期分析不仅不够扎实,而且毫无益处甚至会带来误导。看看2009年金融危机即将到来的时候,还有那么多经济学家信誓旦旦地宣称这一事件不会发生。认为从那种时间尺度的数据就能做出扎实的预测,本身就有很大的问题。
我们还应当记住,在决定哪些数据是保存还是删除的时候,新颖性往往会成为主要的考虑因素。旧的淘汰,新的进来,在这个搜索算法本质上偏向于新鲜事物的数字世界中,这是明显的趋势。从高等法院的裁决,到所有的社交媒体服务平台上,我们到处都可以看到已经失效的网址。对当前的偏好已经渗透到我们身边几乎所有的技 术中,大多数人已经习惯用个四五年就把原本光鲜亮丽的机器抛弃。
怎么办?这不仅是一个如何更好保存旧数据的问题——尽管这并不是个坏主意,想想我们现在还有什么东西能保留10年的。更重要的是,这个问题关系到确定哪些东西值得优先保存,如何在知识的名义下,确定哪些信息最有意义。
或许我们需要的是“智能遗忘”:让我们的工具变得更会放弃最近的过去,从而在整体视角上保持更大的连续性。这有点像是重新组织一本相片簿,尽管加上了更多的 数学方法。什么时候两百万张照片的价值比两千张照片更低?什么时候较大的样品覆盖的范围反而较小?什么时候细节水平能提供有用的质疑证据,而不是虚假的自信?
许多数据集是无法缩减的,而且在完整的情况下才最宝贵,比如,基因序列、人口统计学数据、地理和物理学的原始观测数据等。科学性越弱,数据规模与数据的质量更可能呈现负相关,此时时间本身就成为更加重要的过滤工具。我们如果不仔细选择过去保存下来的有价值、有意义的东西,那它们就会悄无声息地淹没在如今日益增长的噪音之中。
今天的企业、个人和政府机构都能够获得比以往(甚至就在几年前)大许多数量级的数据,但这些数据并没有获得更多的处理时间。利用越来越高效的工具,董事会成员、首席执行官、政府官员等决策者可以就已有的信息提出更有意义的问题。单纯的堆积不是问题的答案。在一个数据量越来越大的时代,如何选择不知道哪些事情,与选择做什么事情一样重要。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
最近我发现一个绝招,用DeepSeek AI处理Excel数据简直太爽了!处理速度嘎嘎快! 平常一整天的表格处理工作,现在只要三步就能搞 ...
2025-04-01你是否被统计学复杂的理论和晦涩的公式劝退过?别担心,“山有木兮:统计学极简入门(Python)” 将为你一一化解这些难题。课程 ...
2025-03-31在电商、零售、甚至内容付费业务中,你真的了解你的客户吗? 有些客户下了一两次单就消失了,有些人每个月都回购,有些人曾经是 ...
2025-03-31在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的需求持续飙升。世界经济论坛发布的《未来就业报告》, ...
2025-03-28你有没有遇到过这样的情况?流量进来了,转化率却不高,辛辛苦苦拉来的用户,最后大部分都悄无声息地离开了,这时候漏斗分析就非 ...
2025-03-27TensorFlow Datasets(TFDS)是一个用于下载、管理和预处理机器学习数据集的库。它提供了易于使用的API,允许用户从现有集合中 ...
2025-03-26"不谋全局者,不足谋一域。"在数据驱动的商业时代,战略级数据分析能力已成为职场核心竞争力。《CDA二级教材:商业策略数据分析 ...
2025-03-26当你在某宝刷到【猜你喜欢】时,当抖音精准推来你的梦中情猫时,当美团外卖弹窗刚好是你想吃的火锅店…… 恭喜你,你正在被用户 ...
2025-03-26当面试官问起随机森林时,他到底在考察什么? ""请解释随机森林的原理""——这是数据分析岗位面试中的经典问题。但你可能不知道 ...
2025-03-25在数字化浪潮席卷的当下,数据俨然成为企业的命脉,贯穿于业务运作的各个环节。从线上到线下,从平台的交易数据,到门店的运营 ...
2025-03-25在互联网和移动应用领域,DAU(日活跃用户数)是一个耳熟能详的指标。无论是产品经理、运营,还是数据分析师,DAU都是衡量产品 ...
2025-03-24ABtest做的好,产品优化效果差不了!可见ABtest在评估优化策略的效果方面地位还是很高的,那么如何在业务中应用ABtest? 结合企业 ...
2025-03-21在企业数据分析中,指标体系是至关重要的工具。不仅帮助企业统一数据标准、提升数据质量,还能为业务决策提供有力支持。本文将围 ...
2025-03-20解锁数据分析师高薪密码,CDA 脱产就业班助你逆袭! 在数字化浪潮中,数据驱动决策已成为企业发展的核心竞争力,数据分析人才的 ...
2025-03-19在 MySQL 数据库中,查询一张表但是不包含某个字段可以通过以下两种方法实现:使用 SELECT 子句以明确指定想要的字段,或者使 ...
2025-03-17在当今数字化时代,数据成为企业发展的关键驱动力,而用户画像作为数据分析的重要成果,改变了企业理解用户、开展业务的方式。无 ...
2025-03-172025年是智能体(AI Agent)的元年,大模型和智能体的发展比较迅猛。感觉年初的deepseek刚火没多久,这几天Manus又成为媒体头条 ...
2025-03-14以下的文章内容来源于柯家媛老师的专栏,如果您想阅读专栏《小白必备的数据思维课》,点击下方链接 https://edu.cda.cn/goods/sh ...
2025-03-13以下的文章内容来源于刘静老师的专栏,如果您想阅读专栏《10大业务分析模型突破业务瓶颈》,点击下方链接 https://edu.cda.cn/go ...
2025-03-12以下的文章内容来源于柯家媛老师的专栏,如果您想阅读专栏《小白必备的数据思维课》,点击下方链接 https://edu.cda.cn/goods/sh ...
2025-03-11