京公网安备 11010802034615号
经营许可证编号:京B2-20210330
机器学习中,我们最常遇到的就是无监督,有监督,半监督了。无监督和有监督的区别,小编之前跟大家分享过,今天跟大家分享的是无监督机器学习中常见的聚类算法,希望对大家无监督学习有所帮助。
一、基本概念
1.无监督学习:
无监督学习是机器学习的一种方法,根据类别未知(没有被标记)的训练样本解决模式识别中的各种问题。无监督学习应用主要包含:聚类分析、关系规则、维度缩减。
2.聚类:
无监督学习里典型例子是聚类。聚类是把相似的对象通过静态分类的方法分成不同的组别或者更多的子集,这样让在同一个子集中的成员对象都有相似的一些属性,常见的包括在坐标系中更加短的空间距离等。
最常见的无监督聚类算法:
K均值聚类
分层聚类
基于密度的扫描聚类(DBSCAN)
二、无监督聚类算法--K均值聚类
K均值聚类 是我们最常用的基于欧式距离的聚类算法,它是数值的、非监督的、非确定的、迭代的,该算法旨在最小化一个目标函数——误差平方函数(所有的观测点与其中心点的距离之和),其认为两个目标的距离越近,相似度越大,由于具有出色的速度和良好的可扩展性,K均值聚类算得上是最著名的聚类方法。
1.K均值中最常用的距离是欧氏距离平方。m维空间中两点x和y之间的距离的示例是:
这里,j是采样点x和y的第j维(或特征列)。
集群惯性是聚类上下文中给出的平方误差之和的名称,表示如下:
其中μ(j)是簇j的质心,并且如果样本x(i)在簇j中则w(i,j)是1.否则是0.
K均值可以理解为试图最小化群集惯性因子的算法。
2.具体算法
(1)选择k值,即我们想要查找的聚类数量。
(2)算法将随机选择每个聚类的质心。
(3)将每个数据点分配给最近的质心(使用欧氏距离)。
(4)计算群集惯性。
(5)将计算新的质心作为属于上一步的质心的点的平均值。换句话说,通过计算数据点到每个簇中心的最小二次误差,将中心移向该点。
(6)返回第3步。
二、无监督聚类算法--分层聚类
1.分层聚类是基于prototyope的聚类算法的替代方案。分层聚类的主要优点是不需要指定聚类的数量,它会自己找到它。此外,它还可以绘制树状图。树状图是二元分层聚类的可视化。
在底部融合的观察是相似的,而在顶部的观察是完全不同的。对于树状图,基于垂直轴的位置而不是水平轴的位置进行结算。
2.分层聚类的类型
分层聚类有两种方法:集聚和分裂。
分裂:这种方法首先将所有数据点放入一个集群中。 然后,它将迭代地将簇分割成较小的簇,直到它们中的每一个仅包含一个样本。
集聚:这种方法从每个样本作为不同的集群开始,然后将它们彼此靠近,直到只有一个集群。
3.分层聚类优缺点
分层聚类的优点;
(1)由此产生的层次结构表示可以提供非常丰富的信息。
(2)树状图提供了一种有趣且信息丰富的可视化方式。
(3)当数据集包含真正的层次关系时,它们特别强大。
分层聚类的缺点:
(1)分层聚类对异常值非常敏感,并且在其存在的情况下,模型性能显着降低。
(2)从计算上讲,分层聚类非常昂贵。
三、无监督聚类算法--DBSCAN 聚类
DBSCAN(带噪声的基于密度的空间聚类方法)是一种流行的聚类算法,它被用来在预测分析中替代 K 均值算法。它并不要求输入簇的个数才能运行。但是,你需要对其他两个参数进行调优。
优缺点:
1.优点
①不需要指定簇的个数;
②可以对任意形状的稠密数据集进行聚类,相对的,K-Means之类的聚类算法一般只适用于凸数据集;
③擅长找到离群点(检测任务);
④两个参数ε\varepsilonε和minPts就够了;
⑤聚类结果没有偏倚,相对的,K-Means之类的聚类算法初始值对聚类结果有很大影响。
2.缺点
①高维数据有些困难;
②Sklearn中效率很慢(数据削减策略);
③如果样本集的密度不均匀、聚类间距差相差很大时,聚类质量较差,这时用DBSCAN聚类一般不适合;
④调参相对于传统的K-Means之类的聚类算法稍复杂,主要需要对距离阈值ε\varepsilonε,邻域样本数阈值MinPts联合调参,不同的参数组合对最后的聚类效果有较大影响。
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
【核心关键词】软件、洞察力、大数据、产品、经验、硬件、流量、创新、决策、数据安全、网络安全、数据分析、决策制定、数据挖 ...
2026-06-18在方案选型、效果复盘、产品评估、供应商筛选等各类业务决策场景中,仅凭单一指标下结论往往会陷入 “以偏概全” 的误区。多维度 ...
2026-06-18 很多数据分析师精通Excel单元格操作,但当被问到“表结构数据的基本处理单位是什么”“字段和记录的本质区别”“为什么表结 ...
2026-06-18在数据分析、用户运营与业务增长的工作体系中,漏斗拆解是最基础也最高频的问题定位方法。很多业务场景下,我们只能看到最终的转 ...
2026-06-17在数据库开发、数据清洗与报表统计场景中,数值类型转换为日期是高频刚需操作。业务系统常以 Unix 时间戳、整型日期(如20240617 ...
2026-06-17 数据分析师八成以上的时间在和数据表格打交道,但许多人拿到Excel后习惯性地先算、先分析,结果回头发现漏了一列关键数据, ...
2026-06-17【核心关键词】数据库、电商、知识、产品、数据产品、监管业务、产品经理、业务系统、用户行为分析、用户分析、数据分析、电商 ...
2026-06-16在 Python 动态类型与面向对象的编程体系中,变量定义与类实例化是构建代码逻辑的两大核心基石。变量是数据存储、传递与运算的基 ...
2026-06-16 很多数据分析师每天与Excel打交道,但当被问到“表格结构数据和表结构数据有什么区别”“数据类型误判会引发哪些分析错误” ...
2026-06-16在 MySQL 查询性能优化体系中,索引是降低查询耗时、提升数据库吞吐的核心手段。其中联合索引与覆盖索引是实际开发中最高频的两 ...
2026-06-15在数据仓库建设与商业智能分析体系中,维度建模是应用最广泛的建模方法论,而事实表与维度表是维度建模的两大核心构件,共同构成 ...
2026-06-15 很多数据分析师能熟练计算指标,但当被问到“这家企业的核心业务目标是什么”“如何把模糊的战略目标拆解为可量化的指标”“ ...
2026-06-15在数据分析、业务监控、运营复盘等场景中,列值趋势计算是核心需求之一。无论是分析销售额的月度增长、用户活跃的变化趋势、库存 ...
2026-06-12在数字经济深度渗透的当下,消费者的购买行为已从过去的 “被动接受” 转变为 “主动决策”。流量红利消退、获客成本攀升、用户 ...
2026-06-12CDA三级认证是三个级别中的塔尖,全面考察数据战略、团队领导和复杂项目的综合能力。它所对应的《敏捷数据挖掘》教材,不再局限 ...
2026-06-12在游戏产业的商业逻辑中,付费玩家是支撑游戏生存与发展的核心支柱。行业普遍遵循 “二八定律”:20% 的付费玩家贡献了游戏 80% ...
2026-06-11【核心关键词】企业、定位、传统、产品、互联网、可视化、业务侧、数字化、结构化、数据分析、传统制造业、市场状态、发展空间 ...
2026-06-11 解读《CDA二级教材:量化策略分析(2025)》的全景结构与学习逻辑 ” CDA二级认证是企业招聘数据分析师时最常提及的证书门槛 ...
2026-06-11【核心关键词】药企、可视化、营销、分类、数据分析师、销售数据、业务人员、指导方向、分析报告、营销数据、营销医生 【专访摘 ...
2026-06-10在统计学分析、问卷调研、实验验证、业务复盘等场景中,卡方检验与 T 检验是应用最广泛的两类基础假设检验方法。前者专门处理分 ...
2026-06-10