数据分析的基本流程和方法
在大数据时代,数据分析的重要性显得更加突出,但是数据分析是一个相对比较专业的领域。数据分析的目的性很强,数据收集、数据处理和数据建模都要围绕数据分析的目的展开;同时数据分析有对专业知识和技巧要求比较高,如概率统计、数学建模的等。本文将介绍数据分析的基本流程和方法,并以一个数据分析的具体实例来来揭开数据分析的神秘面纱。
某大型牙膏制造企业为了更好地拓展产品市场,有效地管理库存,公司董事会要求销售部门根据市场调查,找出公司生产的牙膏销售量与销售价格、广告投入等之间的关系,从而预测出在不同价格和广告费用下的销售量。
定义问题
明确数据分析目标是数据分析的出发点。明确数据分析目标就是要明确本次数据分析要研究的主要问题和预期的分析目标等,简单的说就是定义问题。
针对这个具体问题,最根本的目标是预测不同价格和广告费用下的销售量,而且也决定了途径,找出牙膏销售量与销售价格和广告投入之间的关系。所以预期的分析目标确定了,就是预测不同价格和广告费用下的销售量,主要问题如何找到牙膏销售量与销售价格和广告投入之间的关系。
当对研究对象的内在特性和各因素间的关系有比较充分的认识时,一般用机理分析方法进行数据分析,但是如果由于客观事物内部规律的复杂性及人们认识程度的限制,无法分析实际对象内在的因果关系,建立合乎机理规律的数学模型,那么通常的办法是搜集大量的数据,基于对数据的统计分析找到相关因素的关系。
预测牙膏销量的问题,是一个“灰箱”问题,无法准确地在已掌握市场运行规律的基础上去推理分析药膏销量与价格和广告投入之间的关系,再者,要考虑到市场中不只是只有一家牙膏公司。显然,整个问题是无法通过简单推理分析来确定销量与价格和广告投入之间的关系的。
收集数据
正确收集数据是指从分析目标出发,排除干扰因素,正确收集服务于既定分析目标的数据。正确的数据对于实现数据分析目的将起到关键性的作用。如何正确的收集数据呢?简单的说就是用恰当的数据收集方法收集正确的的数据。
总体上讲有三类原始数据收集的方法原始数据包括实验方法、调查方法、观察方法等,
实验研究是一种受控的观测方法,通过一个或多个自变量的变化来评估它对一个或多个因变量产生的效应。统计调查研究(survey research)已经广泛应用于各个领域,包括政治学、社会学、经济学、教育学和管理学科。它是以研究样本的数据为基础辨析总体状况的研究方法。实地研究(fieldresearch)是对自然状态下的研究对象进行直接观察,收集一段时期内若干变量的数据。实地研究(fieldresearch)是对自然状态下的研究对象进行直接观察,收集一段时期内若干变量的数据。每种数据收集的方法都有自己的优缺点和适用范围,这里不详谈。
针对这个问题将采用样本统计调查(sample survey)的方法,但是该收集那些数据呢?研究的主要问题就是发现本公司牙膏销量与牙膏价格和广告投入的关系。正确的数据肯定包含该公司各个销售周期的销售量、销售价格和广告投入。但是从上面的分析中可以看到,本公司的牙膏销量绝对和其他公司的牙膏价格有关系,因此把其他牙膏公司的销售价格也作为数据收集对象。
数据处理
在明确数据分析目标基础上收集到的数据,往往还需要进行必要的加工整理后才能真正用于分析建模。数据的加工整理通常包括数据缺失值处理、数据的分组、基本描述统计量的计算、基本统计图形的绘制、数据取值的转换、数据的正态化处理等,它能够帮助人们掌握数据的分布特征,是进一步深入分析和建模的基础。
回到具体问题,收集到的数据有该公司的每个销售周期的牙膏销售量、价格、广告投入、和其他牙膏公司的价格。其他牙膏公司的价格和各公司的牙膏销售量有关系,但是其他公司的药膏价格却是有很多统计变量组成的,但是这些变量的影响作用是具有同样的规律,可以把这些变量看做一个整体,于是可以对这些统计变量做个取均值的处理,这是对数据处理的第一步。
由于牙膏是生活必需品,对大多数顾客来说,在购买同类产品的牙膏时更多地会在意不同品牌之间的价格差异,而不是它们的价格本身因此,在研究各个因素对销售量的影响时,用价格差代替公司销售价格和其它厂家平均价格更为合适。这是对数据处理的第二步。
记牙膏销售量为y,其它厂家平均价格与公司销售价格之差(价格差)为x1公司投入的广告费用为x2,其它厂家平均价格和公司销售价格分别为x3和x4, x1=x3-x4.
为了大致分析请y与x1和x2的关系,我们可以分别简单的绘制y对x1和x2的散点图。
图 1 y对x1的散点图
从图1可以发现,随着x1的增加,y的值有比较明显的线性增长趋势,图中的直线是用线性模型。
图 2 y对x2的散点图
当x2增大时,y有向上弯曲增加的趋势,图中的曲线使用二次函数拟合的,可以看到二者具有非线性关系。
数据加工整理完成后一般就可以进行进一步的数据分析了。分析时应切忌滥用和误用统计分析方法。滥用和误用统计分析方法主要是由于对方法能解决哪类问题、方法适用的前提、方法对数据的要求不清等原因造成的。另外,统计软件的不断普及和应用中的不求甚解也会加重这种现象。因此,在数据分析中应避免盲目的"拿来主义",否则,得到的分析结论可能会偏差较大甚至发生错误。
另外,选择几种统计分析方法对数据进行探索性的反复分析也是极为重要的。每一种统计分析方法都有自己的特点和局限,因此,一般需要选择几种方法反复印证分析,仅依据一种分析方法的结果就断然下结论是不科学的。
很对本问题,经过数据的简单处理和分析,已经可以看到销售量总体上和价格差成线性关系,销售量和广告投入上成非线性关系,因此可以建立一个回归模型,根据统计信息来求解模型,获得变量的系数,完成对模型的求解。
从图1可以发现,随着x1的增加,y的值有比较明显的线性增长趋势,可以得到公式1,
(1)
从图2中可以你发现,当x2增大时,y有向上弯曲增加的趋势,可以得到公式2,
(2)
根据以上分析可以建立如下回归模型(3)
(3)
其中和成为回归变量,,,,就是回归系数,影响的其它因素包含在随机误差中。
直接利用MATLAB中统计工具箱中的命令regress求解,使用格式为
[b,bint,r,rint,stats] = regress(y,x,alpha).其中,y为表中30个周期的销售量,长度为30的一向量,x为回归系数的数据矩阵[1,,,],是一个30*4的向量,b为回归系数向量的估计值,bint为其置信区间,r为残差向量,rint为残差向量的置信区间,stats为回归模型的检验统计量,包括三个变量,回归方程的决定系数,F统计变量值,与F统计变量值对应的概率p。
分析与结论
数据分析的直接结果是统计量和统计参数。正确理解它们的统计含义是一切分析结论的基础,它不仅能帮助人们有效避免毫无根据地随意引用统计数字的错误,同时也是证实分析结论正确性和可信性的依据,而这一切都取决于人们能否正确地把握统计分析方法的核心思想。
另外,将统计量和统计参数与实际问题相结合也是非常重要的。客观地说,统计方法仅仅是一种有用的数据分析工具,它绝不是万能的。统计方法是否能够正确地解决各学科的具体问题不仅取决于应用统计方法或工具的人能否正确地选择统计方法,还取决于他们是否具有深厚的应用背景。只有将各学科的专业知识与统计量和统计参数相结合,才能得出令人满意的分析结论。
本问题的计算结果如下:
且=0.9054, F = 82.9409, p= 0
=0.9054表示销售量的90.54%可由上述模型确定,F值远超过F检验的临界值,p远小于0.05,因而从总体上看模型是可用的。
回归模型的一个重要应用是,对于给定的回归变量的取值,可以以一定的置信度预测因变量的取值范围,即预测区间。比如当x1=0.2,x2=6.5 时可以算出牙膏销售量的置信度为95的预测区间[7.8230,8.7636],它表明在将来的某个销售周期中,如公司维持产品的价格差为0.2元,并投入650万元的广告费用,那么可以有95%的把握保证牙膏的销售量在7.8230,8.7636百万支之间,实际操作时,预测上限可以用来作为库存管理的目标值,即公司可以生产(或库存)8.763百万支牙膏来满足该销售周期顾客的需求;预测下限则可以用
来较好地把握(或控制)公司的现金流,理由是公司对该周期销售7.8230 百万支
牙膏十分自信.这在实际中将具有非常大的作用。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
在数据分析领域,Excel作为一种普及率极高且功能强大的工具,无疑为无数专业人士提供了便捷的解决方案。尽管Excel自带了丰富的功 ...
2025-01-17在这个瞬息万变的时代,许多人都在寻找能让他们脱颖而出的职业。而数据分析师,作为大数据和人工智能时代的热门职业,自然吸引了 ...
2025-01-14Python作为一门功能强大的编程语言,已经成为数据分析和可视化领域的重要工具。无论你是数据分析的新手,还是经验丰富的专业人士 ...
2025-01-10完全靠数据决策,真的靠谱吗? 最近几年,“数据驱动”成了商界最火的关键词之一,但靠数据就能走天下?其实不然!那些真正成功 ...
2025-01-09SparkSQL 结构化数据处理流程及原理是什么?Spark SQL 可以使用现有的Hive元存储、SerDes 和 UDF。它可以使用 JDBC/ODB ...
2025-01-09在如今这个信息爆炸的时代,数据已然成为企业的生命线。无论是科技公司还是传统行业,数据分析正在深刻地影响着商业决策以及未来 ...
2025-01-08“数据为王”相信大家都听说过。当前,数据信息不再仅仅是传递的媒介,它成为了驱动经济发展的新燃料。对于企业而言,数据指标体 ...
2025-01-07在职场中,当你遇到问题的时候,如果感到无从下手,或者抓不到重点,可能是因为你掌握的思维模型不够多。 一个好用的思维模型, ...
2025-01-06在现代企业中,数据分析师扮演着至关重要的角色。每天都有大量数据涌入,从社交媒体到交易平台,数据以空前的速度和规模生成。面 ...
2025-01-06在职场中,许多言辞并非表面意思那么简单,有时需要听懂背后的“潜台词”。尤其在数据分析的领域里,掌握常用术语就像掌握一门新 ...
2025-01-04在当今信息化社会,数据分析已成为各行各业的核心驱动力。它不仅仅是对数字进行整理与计算,而是在数据的海洋中探寻规律,从而指 ...
2025-01-03又到一年年终时,各位打工人也迎来了展示成果的关键时刻 —— 年终述职。一份出色的年终述职报告,不仅能全面呈现你的工作价值, ...
2025-01-03在竞争激烈的商业世界中,竞品分析对于企业的发展至关重要。今天,我们就来详细聊聊数据分析师写竞品分析的那些事儿。 一、明确 ...
2025-01-03在数据分析的江湖里,有两个阵营总是争论不休。一派信奉“大即是美”,认为数据越多越好;另一派坚守“小而精”,力挺质量胜于规 ...
2025-01-02数据分析是一个复杂且多维度的过程,从数据收集到分析结果应用,每一步都是对信息的提炼与升华。可视化分析结果,以图表的形式展 ...
2025-01-02在当今的数字化时代,数据分析师扮演着一个至关重要的角色。他们如同现代企业的“解密专家”,通过解析数据为企业提供决策支持。 ...
2025-01-02数据分析报告至关重要 一份高质量的数据分析报告不仅能够揭示数据背后的真相,还能为企业决策者提供有价值的洞察和建议。 年薪 ...
2024-12-31数据分析,听起来好像是技术大咖的专属技能,但其实是一项人人都能学会的职场硬核能力!今天,我们来聊聊数据分析的核心流程,拆 ...
2024-12-31提到数据分析,你脑海里可能会浮现出一群“数字控”抱着电脑,在海量数据里疯狂敲代码的画面。但事实是,数据分析并没有你想象的 ...
2024-12-31关于数据分析师是否会成为失业高危职业,近年来的讨论层出不穷。在这个快速变化的时代,技术进步让人既兴奋又不安。今天,我们从 ...
2024-12-30