K最近邻(KNN,k-Nearest Neighbor)准确理解-CDA数据分析师官网

K最近邻(KNN,k-Nearest Neighbor)准确理解

2016-12-28

K最近邻(KNN,k-Nearest Neighbor)准确理解

用了之后，发现我用的都是1NN，所以查阅了一下相关文献，才对KNN理解正确了，真是丢人了。

下图中，绿色圆要被决定赋予哪个类，是红色三角形还是蓝色四方形？如果K=3，由于红色三角形所占比例为2/3，绿色圆将被赋予红色三角形那个类，如果K=5，由于蓝色四方形比例为3/5，因此绿色圆被赋予蓝色四方形类。

K最近邻(k-Nearest Neighbor，KNN)分类算法，是一个理论上比较成熟的方法，也是最简单的机器学习算法之一。该方法的思路是：如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别，则该样本也属于这个类别。KNN算法中，所选择的邻居都是已经正确分类的对象。该方法在定类决策上只依据最邻近的一个或者几个样本的类别来决定待分样本所属的类别。 KNN方法虽然从原理上也依赖于极限定理，但在类别决策时，只与极少量的相邻样本有关。由于KNN方法主要靠周围有限的邻近的样本，而不是靠判别类域的方法来确定所属类别的，因此对于类域的交叉或重叠较多的待分样本集来说，KNN方法较其他方法更为适合。

其中，x为一篇待分类网页的向量表示；di为训练集中的一篇实例网页的向量表示；cj为一类别；（当d属于c}1,0{),(∈jicdyj时取1；当不属于cdj时取0）；bj为预先计算得到的cj的最优截尾阈值；为待分类网页与网页实例之间的相似度，由文档间的余弦相似度公式（11-10）计算得到：

kNN算法本身简单有效，它是一种lazy-learning算法，分类器不需要使用训练集进行训练，训练时间复杂度为0。kNN分类的计算复杂度和训练集中的文档数目成正比，也就是说，如果训练集中文档总数为n，那么kNN的分类时间复杂度为O(n)。

KNN算法不仅可以用于分类，还可以用于回归。通过找出一个样本的k个最近邻居，将这些邻居的属性的平均值赋给该样本，就可以得到该样本的属性。更有用的方法是将不同距离的邻居对该样本产生的影响给予不同的权值(weight)，如权值与距离成正比。

该算法在分类时有个主要的不足是，当样本不平衡时，如一个类的样本容量很大，而其他类样本容量很小时，有可能导致当输入一个新样本时，该样本的 K个邻居中大容量类的样本占多数。因此可以采用权值的方法（和该样本距离小的邻居权值大）来改进。该方法的另一个不足之处是计算量较大，因为对每一个待分类的文本都要计算它到全体已知样本的距离，才能求得它的K个最近邻点。目前常用的解决方法是事先对已知样本点进行剪辑，事先去除对分类作用不大的样本。该算法比较适用于样本容量比较大的类域的自动分类，而那些样本容量较小的类域采用这种算法比较容易产生误分。cda数据分析培训

CDA数据分析师考试相关入口一览（建议收藏）：

▷ 想报名CDA认证考试，点击>>> “CDA报名” 了解CDA考试详情；

▷ 想加入CDA考试题库，点击>>> “CDA题库” 了解CDA考试详情；

▷ 想学习CDA考试教材，点击>>> “CDA教材” 了解CDA考试详情；

▷ 想查询CDA考试成绩，点击>>> “CDA成绩” 了解CDA考试详情；

▷ 想了解CDA考试含金量，点击>>> “CDA含金量” 了解CDA考试详情；

▷ 想获取CDA考试时间/费用/条件/大纲/通过率，点击 >>>“CDA考试官网” 了解CDA考试详情；

KNN 特征空间特征机器学习数据分析

数据分析咨询请扫描二维码

若不方便扫码，搜微信号：CDAshujufenxi

上一篇图论在大数据分析中的作用！

下一篇CDA认证再升一档！与国家共同推进大数据人才培养标准教育事业！

K最近邻(KNN,k-Nearest Neighbor)准确理解

CDA考试动态

CDA报考指南

热门栏目

最新资讯

【干货】4年大厂数据分析师：用户旅程分析的3个关键 ...

【干货】竞品分析怎么写？戳此了解深度指南！ ...

excel没有数据分析怎么添加

转行数据分析师就是找死

python可视化数据分析

用数据还是靠经验？成功企业都找到了这个平衡点！ ...

Spark SQL 结构化数据处理流程及原理是什么？ ...

数据分析岗位是干什么的

字节大神：讲透数据指标体系搭建的3个关键步骤 ...

提升思维能力！数据分析必学的5大经典模型解析！ ...

数据分析师的工作内容

【干货】互联网黑话多？谁说这术语老啊？这术语太棒 ...

数据分析包括哪些内容

【干货】数分人年终述职指南：解锁高效汇报秘籍 ...

【干货】竞品分析怎么写？戳此了解深度指南！ ...

数据分析的终极对决：大数据还是小数据，谁才是真正 ...

如何做数据分析图表

数据分析师就业前景

字节70W年薪数据分析师：数据分析报告撰写的4个要点 ...

数据分析的基本流程