马云在2012年网商大会上的演讲中说过:“假如我们数据分析师有了一个数据预报台,就像为企业装上了一个GPS和雷达,企业的出海将会更有把握。”。这里的数据预报台就是下文所述的商业智能。
什么是商业智能(Business Intelligence)
数据挖掘的最终目的是要实现数据的价值,而商业智能是在企业中实现数据价值的最佳方式之一。商业智能(Business Intelligence,简 称BI)的概念最早是Gartner公司于1996年提出来的。当时将商业智能定义为一类由数据仓库(或数据集市)、查询报表、数据分析、数据挖掘、数据备份和恢复等部分组成的,以帮助企业决策为目的技术及其应用。Gartner 公司的Howard Dressner把商业智能定义成为把数据转化成信息,并通过迭代发现(Iterative Discoveries)把信息转化成商业上可用的知识。
在我们数据分析师看来,商业智能就是能够从(海量)业务和相关数据中提取有用的信息,把信息转化成知识,然后根据这些知识采用正确的商务行为的工具。在本书的范畴内,我们提到的BI(商业智能)工具都是指在数据挖掘基础上的工具。如图所示。
商业智能示意图
现在数据挖掘技术在商业应用中已经相当广泛,因为对数据挖掘技术进行支持的三种基础技术已经发展成熟,这三种基础技术是:
商业数据库现在正在以一个空前的速度增长,并且数据仓库正在广泛地应用于各种行业。对计算机硬件性能越来越高的要求,也可以用现在已经成熟的并行多处理机的技术来满足。另外数据挖掘算法经过了这10多年的发展也已经成为一种成熟、稳定,且易于理解和操作的技术。
现在面临的尴尬的境地是数据丰富,信息匮乏(Data Rich But Information Poor)。快速增长的海量数据,已经远远地超过了人们的理解能力,如果不借助强有力的工具,很难弄清大堆数据中所蕴含的知识。结果,重要决策只是基于制定决策者的个人经验,而不是基于信息丰富的数据。数据挖掘就这样应运而生,数据挖掘填补了数据和信息之间的鸿沟。Erik Brynjolfsson曾经说过:有数据支持的(商业)决定总是更好的决定。数据在商业运营上要能起到作用,我们必须要做到:
在最开始制定商业智能数据战略时,考虑的不应该是技术,而是从商业角度出发,看到底需要完成怎样的商业目标,再来制定数据挖掘过程。
比如在商业银行信用卡部门,我们需要做信用卡欺诈监测。商业目的很明确,就是要以最快的速度发现90%以上的欺诈交易,而可以提供的数据就是之前所有的交易记录。那么如何判别某一个交易可能是欺诈行为呢?常用的数据挖掘方式是通过神经网络。我们通过正面和负面的实例训练这个神经网络,然后给每个交易打分,如果低于某个数值,那么就判定这条交易是正常的,否则就判定它为欺诈交易。
商业智能还有一个重要的原因是竞争。现在的企业竞争对象不一定来自身边,甚至不一定来自于同一个国家,商业竞争的全球化导致了中国企业必须提高对商业智能的重视,因为商业智能在欧美的企业中正相当普及。
当我们已经建立了一套完整的商业智能系统之后,可以通过如图所示的流程来定期做数据分析。
商业智能分析示意图
下面我们对上图的商业智能分析中的各个阶段做个简单的解释。
看趋势:即观察关键考核指标KPI数据的日、周、月、季度、年的图表曲线趋势。KPI数据是上升了还是下降了。关联的其他相关KPI曲线,是否呈现了应该有的关联性。环比同比的百分比如何等。
寻找变异:即找到单一KPI数据中的异常值,或者关联数据中非关联的异常部分。
分析原因:当我们数据分析师找到了异常值,就需要分析造成这一异常的原因。看异常发生的时间节点,看内部和外部的关联活动,看问题发生原因的构成,并把原因分解成独立的元素一一列出,标出权重,哪些是相对影响较大的,哪些又是可能的原因等。
制定对策:数据分析师在正确的分析了相关原因后,就需要给出解决方法和策略。一般来说,一个原因对应一个解决策略。当然也可能有多个解决策略对应于同一个原因。我们选择最切合实际,最可执行的对策和行动策略。
数据挖掘通用流程CRISP-DM的缔造者之一Tom Khabaza曾总结了在数据挖掘上的九大定律,如下所示。
(1)Business Goals Law:每个数据挖掘解决方案的根源都是有商业目的的。
(2)Business Knowledge Law:数据挖掘过程的每一步都需要以商业信息为中心。
(3)Data Preparation Law:数据挖掘过程前期的数据准备工作要超过整个过程的一半。
(4)NFL Law:NFL(没有免费午餐,No Free Lunch)。 对于数据挖掘者来说没有免费的午餐,数据挖掘的任何一个过程都是来之不易的。
(5)Watkins’ Law:此定律以此命名是因为David Watkins首次提出这个概念。这个定律说的是在数据的世界里,总是有模式可循的。您找不到规律不是因为规律不存在,而是因为您还没有发现它。
(6)Insight Law:数据挖掘可以把商业领域的信息放大。
(7)Prediction Law:预测可以为我们增加信息。
(8)Value Law:数据挖掘模式的精准和稳定并不决定数据挖掘过程的价值,换句话说技术手段再精妙,没有商业意义和合适的商业应用是没有价值的。
(9)Law of Change:所有的模式都会变化。
上面这九条其实归根到底就是一条,商业决定数据挖掘。数据挖掘各类技术和算法的飞速发展不能让我们偏离以商业行为为核心的方向,只是纯粹为了追求高深的技术而忽略或损害到商业目的就本末倒置了。
数据挖掘的世界既是地雷阵,同时又是金矿。大量的数据没能被及时处理,称得上是暴殄天物。虽然通过保存相关数据,我们可以保证以后对数据信息的方便使用,但是对于工作量日趋繁
重的数据保存工作,很多企业可能还是选择荒废部分数据。大数据时代已经来临,不管有多大困难,我们从现在开始都需要考虑评估和集成数据挖掘应用。即使不能找到合适的数据挖掘方法来处理数据,至少我们需要用数据仓库把原始数据保留起来,以供将来使用。
下面列举一些我们在给企业做数据挖掘时看到的问题:
对于数据挖掘需要解决的问题,很少有现成的解决方案,而且于某个问题,可能有多种数据挖掘算法可以使用,但通常只有一个最好的算法。当我们选择了一个数据挖掘算法时,首先要弄清楚它是否适合想解决的问题。如果本身方法选择不合适,那么再好的执行也没有用。
从市场角度来看,数据挖掘依旧面临其他因素的挑战。数据挖掘非常有前景,但是市场中数据噪声太多,会导致数据价值大大降低。以无线营销为例,大量的虚假应用下载和使用以及虚假好评差评等数据严重干扰了数据的准确性,大大降低了数据的价值。
在中国,数据挖掘市场整体来说还不成熟。首先在意识上,一些商业领袖们对数据挖掘将信将疑,不愿意做投入;另一方面,采用了数据挖掘的公司只追求最后的结果,而对数据挖掘过程、数据的存储、数据挖掘结果的知识积累和呈现不重视。
数据挖掘有时导出的结果是不完善的,每次导出的结果和应用的数据集直接相关。如果数据集发生变化,就需要重新进行挖掘。如果没有考虑数据变化而盲目采用数据变化之前的策略,那么结果是不可预料的。
这些问题都是确实存在的,其中关于市场的问题在一定时间之后会有好转,而数据挖掘过程中的这些问题就需要数据分析师和数据应用使用者提高自己的经验来解决了。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
“最近复购率一直在下降,我们的营销力度不小啊,为什么用户还是走了?” “是不是广告投放的用户质量不高?还是我们的产品问题 ...
2025-02-21以下文章来源于数有道 ,作者数据星爷 SQL查询是数据分析工作的基础,也是CDA数据分析师一级的核心考点,人工智能时代,AI能为 ...
2025-02-19在当今这个数据驱动的时代,几乎每一个业务决策都离不开对数据的深入分析。而其中,指标波动归因分析更是至关重要的一环。无论是 ...
2025-02-18当数据开始说谎:那些年我们交过的学费 你有没有经历过这样的场景?熬了三个通宵做的数据分析报告,在会议上被老板一句"这数据靠 ...
2025-02-17数据分析作为一门跨学科领域,融合了统计学、编程、业务理解和可视化技术。无论是初学者还是有一定经验的从业者,系统化的学习路 ...
2025-02-17挖掘用户价值本质是让企业从‘赚今天的钱’升级为‘赚未来的钱’,同时让用户从‘被推销’变为‘被满足’。询问deepseek关于挖 ...
2025-02-17近来deepseek爆火,看看deepseek能否帮我们快速实现数据看板实时更新。 可以看出这对不知道怎么动手的小白来说是相当友好的, ...
2025-02-14一秒精通 Deepseek,不用找教程,不用买资料,更不用报一堆垃圾课程,所有这么去做的,都是舍近求远,因为你忽略了 deepseek 的 ...
2025-02-12自学 Python 的关键在于高效规划 + 实践驱动。以下是一份适合零基础快速入门的自学路径,结合资源推荐和实用技巧: 一、快速入 ...
2025-02-12“我们的利润率上升了,但销售额却没变,这是为什么?” “某个业务的市场份额在下滑,到底是什么原因?” “公司整体业绩 ...
2025-02-08活动介绍 为了助力大家在数据分析领域不断精进技能,我们特别举办本期打卡活动。在这里,你可以充分利用碎片化时间在线学习,让 ...
2025-02-071、闺女,醒醒,媒人把相亲的带来了。 我。。。。。。。 2、前年春节相亲相了40个, 去年春节相亲50个, 祖宗,今年你想相多少个 ...
2025-02-06在数据科学的广阔领域中,统计分析与数据挖掘占据了重要位置。尽管它们常常被视为有关联的领域,但两者在理论基础、目标、方法及 ...
2025-02-05在数据分析的世界里,“对比”是一种简单且有效的方法。这就像两个女孩子穿同一款式的衣服,效果不一样。 很多人都听过“货比三 ...
2025-02-05当我们只有非常少量的已标记数据,同时有大量未标记数据点时,可以使用半监督学习算法来处理。在sklearn中,基于图算法的半监督 ...
2025-02-05考虑一种棘手的情况:训练数据中大部分样本没有标签。此时,我们可以考虑使用半监督学习方法来处理。半监督学习能够利用这些额 ...
2025-02-04一、数学函数 1、取整 =INT(数字) 2、求余数 =MOD(除数,被除数) 3、四舍五入 =ROUND(数字,保留小数位数) 4、取绝对值 =AB ...
2025-02-03作者:CDA持证人 余治国 一般各平台出薪资报告,都会哀嚎遍野。举个例子,去年某招聘平台发布《中国女性职场现状调查报告》, ...
2025-02-02真正的数据分析大神是什么样的呢?有人认为他们能轻松驾驭各种分析工具,能够从海量数据中找到潜在关联,或者一眼识别报告中的数 ...
2025-02-01现今社会,“转行”似乎成无数职场人无法回避的话题。但行业就像座围城:外行人看光鲜,内行人看心酸。数据分析这个行业,近几年 ...
2025-01-31