数据挖掘的基本概念：数据库、数据仓库、机器学习，统计学-CDA数据分析师官网

数据挖掘的基本概念：数据库、数据仓库、机器学习，统计学

2017-07-23

“数据挖掘“(Data Mining)又被称为“数据中的知识发现”（KDD），顾名思义，也就是通过数据清理、数据集成、数据选择、数据变换、数据挖掘、模式评估、知识表示等一些列步骤，对数据进行分类、聚类，发现其中的关联关系或者离群点，来发现新的知识。

1、数据类型

上世纪70-80年代，“数据库”技术的发展而产生的数据库管理系统，方便用户进行关系型的数据管理，用户可以进行SQL查询等数据操作，关系型数据库实际上就是二维表；然而对于大型的跨地域公司，要汇总各个地方数据库却不容易，于是就产生了“数据仓库”，数据仓库将数据库的数据进行整合，下钻（drill down）和上卷（roll up）操作可以得到详细信息和汇总信息，由此诞生了高级数据库系统和高级数据分析，数据仓库可以看做是数据立方体（Data Cube）。20世纪90年代，万维网迅速发展，各式各类的数据类型出现，时间序列数据、超文本和多媒体数据（图片、视频、声音），空间数据（地图），网状数据（社会关系网络）等各种复杂的非结构化数据，总之，可以大致的将数据挖掘的数据类型分为以下几类：
（１）数据库数据

数据库系统，又称为数据库管理系统（DBMS），是一种关系型数据库，又不同的表组成，每一个表有一个唯一的“关键字标识”来表示一个对象，每个对象有又若干属性，每个对象及其属性构成一个“元组”。

对于一个学生关系表，学号是唯一的“关键字标识”，姓名、性别、院系、年级都是属性，每一行都是一个“元组”。
（２）数据仓库　数据

数据立方体

数据仓库的数据格式可以看做是一个数据立方体，是一个多维的数据结构，如图有三个维度，分别是时间维、机构维、指标维。对数据立方体进行切片可以得到截面数据，竖直方向切片可以得到周一（Monday）三个地方借记卡情况。
下钻是对数据的具体化，如对时间维下钻，可以得到周一10:00至14:00的四个小时内的借记卡使用情况；
上卷又称上钻，是对数据汇总，对机构维上卷，可以得到中国借记卡使用情况。
（3）事务数据
事务数据库数据中每个记录是一个事务，如淘宝的一次订单。
（4）其他数据
数据库一般是结构化的数据，还有许多非结构化数据。如序列数据（时间序列、生物序列等），空间数据（地图），工程设计数据（建筑结构设计），超文本和多媒体数据、网状数据等。

2 数据挖掘的步骤

（1）数据清理：消除噪音数据
（2）数据集成：多种数据组合一起
（3）数据选择：选择相关数据
（4）数据变换：汇总等操作将数据变换成适合挖掘的数据
（5）数据挖掘：对数据进行操作
（6）模式评估：根据某种模式来评估其价值
（7）知识表示：可视化表现

3 数据挖掘模式

（1）类和概念：特征化与区分
对数据汇总和分类，考察其具有什么样的特征。
（2）挖掘频繁模式：关联和相关性
频繁出现的序列：出现次数最多的事件；频繁出现的子序列：事件之间的关联性，如购买A的情况下再购买B的模式
（3）预测分析的分类和回归
分类：决策树、神经网络

回归：相关性描述和预测，描述解释变量与被解释变量之间的相关性，并构造数学模型来预测被解释变量。
（4）聚类
根据“最大化类内相似性，最小化类间相似性”的原则进行聚类和分组。

（5）离群点
异常的值，有的时候需要抛弃异常值，但有时通过异常值可以发现问题，如欺诈行为。

4 数据挖掘相关内容

（1）统计学
统计学中数值描述（如均值、中位数、众数、方差，柱状图、散点图等），回归分析（线性回归、非线性回归、一元回归、多元回归），离散型和连续性数据的概率分布、描述性统计和推断性统计都和数据挖掘相关。
（2）机器学习
 机器学习是用数据对机器不断训练以来提高机器性能，类似条件反射。比如机器最开始只能识别“中华田园犬”，“犬”类库中只有中华田园犬，通过一次又一次学习，将萨摩耶、吉娃娃、哈士奇、泰迪都纳入“犬”库，机器就知道了这些也是“犬”。随着图片和种类的增加，机器对犬的识别度也逐渐增加。
（3）数据库和数据仓库
数据库和数据仓库本身就是用于数据的管理，其包含的海量数据可以用来做OLTP，OLAP。
（4）信息检索

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试详情；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试详情；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

数据挖掘数据仓库机器学习特征关系型数据库线性回归 SQL 神经网络

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇图论在大数据分析中的作用！

下一篇CDA认证再升一档！与国家共同推进大数据人才培养标准教育事业！

数据挖掘的基本概念：数据库、数据仓库、机器学习，统计学

CDA考试动态

CDA报考指南

热门栏目

最新资讯

非专业，怎么才能证明自己的数据分析能力？ ...

保姆级教程！一文读懂数据分析师的职业发展路径 ...

【干货】用DeepSeek三步骤搞定Excel数据清洗，效率 ...

被统计公式劝退？这门极简课程让你14天学会用Python ...

【干货】如何用RFM模型精准识别高价值客户？ ...

CDA数据分析师就业班3月29日开班，仅剩1个名额 ...

【案例】网飞Netflix流量漏斗分析案例 ...

tensorflow_datasets 如何load本地的数据集？ ...

《CDA二级教材》试读版上线CDA网校，助你轻松拿下二 ...

【干货】3步带你画出用户DNA，精准营销更进一步 ...

什么是随机森林，它的优缺点是什么？：面试标准答案 ...

【干货】电商营收暴跌40%，如何排查？ ...

【干货】如何通过精细化运营提升 DAU 指标？ ...

【干货】AB test 在业务中的落地应用

自上而下的指标体系构建全攻略

解锁数据分析师高薪密码，CDA 脱产就业班助你逆袭！ ...

如何在mysql语句中查询一个表,但不包含某字段? ...

深度解析用户画像：数据运营的核心力量 ...

2025年AI智能体元年，数据分析师会被替代吗？ ...

【案例】业务数据分析方法之多维度拆解 ...