Canopy聚类算法是一个将对象分组到类的简单、快速、精确地方法。每个对象用多维特征空间里的一个点来表示。这个算法使用一个快速近似距离度量和两个距离阈值 T1>T2来处理。基本的算法是,从一个点集合开始并且随机删除一个,创建一个包含这个点的Canopy,并在剩余的点集合上迭代。对于每个点,如果它的距离第一个点的距离小于T1,然后这个点就加入这个聚集中。除此之外,如果这个距离<T2,然后将这个点从这个集合中删除。这样非常靠近原点的点将避免所有的未来处理,不可以再做其它Canopy的中心。这个算法循环到初始集合为空为止,聚集一个集合的Canopies,每个可以包含一个或者多个点。每个点可以包含在多于一个的Canopy中。
Canopy算法其实本身也可以用于聚类,但它的结果可以为之后代价较高聚类提供帮助,其用在数据预处理上要比单纯拿来聚类更有帮助。Canopy聚类经常被用作更加严格的聚类技术的初始步骤,像是K均值聚类。建立canopies之后,可以删除那些包含数据点数目较少的canopy,往往这些canopy是包含孤立点的。
Canopy算法的步骤如下:
(1) 将所有数据放进list中,选择两个距离,T1,T2,T1>T2
(2)While(list不为空)
{
随机选择一个节点做canopy的中心;并从list删除该点;
遍历list:
对于任何一条记录,计算其到各个canopy的距离;
如果距离<T2,则给此数据打上强标记,并从list删除这条记录;
如果距离<T1,则给此数据打上弱标记;
如果到任何canopy中心的距离都>T1,那么将这条记录作为一个新的canopy的中心,并从list中删除这个元素;
}
需要注意的是参数的调整:
当T1过大时,会使许多点属于多个Canopy,可能会造成各个簇的中心点间距离较近,各簇间区别不明显;
当T2过大时,增加强标记数据点的数量,会减少簇个个数;T2过小,会增加簇的个数,同时增加计算时间;
下面用Java来简单实现算法,考虑简单,点只用了二维。
public class CanopyBuilder {
private double T1 = 8;
private double T2 = 4;
private List<Point> points = null;
private List<Canopy> canopies = null;
public CanopyBuilder() {
init();
}
public void init() {
points = new ArrayList<Point>();
points.add(new Point(8.1, 8.1));
points.add(new Point(7.1, 7.1));
points.add(new Point(6.2, 6.2));
points.add(new Point(7.1, 7.1));
points.add(new Point(2.1, 2.1));
points.add(new Point(1.1, 1.1));
points.add(new Point(0.1, 0.1));
points.add(new Point(3.0, 3.0));
canopies = new ArrayList<Canopy>();
}
//计算两点之间的曼哈顿距离
public double manhattanDistance(Point a, Point b) {
return Math.abs(a.getX() - b.getX()) + Math.abs(a.getY() - b.getY());
}
//计算两点之间的欧氏距离
public double euclideanDistance(Point a, Point b) {
double sum = Math.pow(a.getX() - b.getX(), 2) + Math.pow(a.getY() - b.getY(), 2);
return Math.sqrt(sum);
}
public void run() {
while (points.size() > 0) {
Iterator<Point> iterator = points.iterator();
while (iterator.hasNext()) {
Point current = iterator.next();
System.out.println("current point: " + current);
//取一个点做为初始canopy
if (canopies.size() == 0) {
Canopy canopy = new Canopy();
canopy.setCenter(current);
canopy.getPoints().add(current);
canopies.add(canopy);
iterator.remove();
continue;
}
boolean isRemove = false;
int index = 0;
for (Canopy canopy : canopies) {
Point center = canopy.getCenter();
System.out.println("center: " + center);
double d = manhattanDistance(current, center);
System.out.println("distance: " + d);
//距离小于T1加入canopy,打上弱标记
if (d < T1) {
current.setMark(Point.MARK_WEAK);
canopy.getPoints().add(current);
} else if (d > T1) {
index++;
}
//距离小于T2则从列表中移除,打上强标记
if (d <= T2) {
current.setMark(Point.MARK_STRONG);
isRemove = true;
}
}
//如果到所有canopy的距离都大于T1,生成新的canopy
if (index == canopies.size()) {
Canopy newCanopy = new Canopy();
newCanopy.setCenter(current);
newCanopy.getPoints().add(current);
canopies.add(newCanopy);
isRemove = true;
}
if (isRemove) {
iterator.remove();
}
}
}
for (Canopy c : canopies) {
System.out.println("old center: " + c.getCenter());
c.computeCenter();
System.out.println("new center: " + c.getCenter());
ShowUtils.print(c.getPoints());
}
}
public static void main(String[] args) {
CanopyBuilder builder = new CanopyBuilder();
builder.run();
}
}
Canopy类
[java] view plain copy
public class Canopy {
private Point center = null;
private List<Point> points = null;
public Point getCenter() {
return center;
}
public void setCenter(Point center) {
this.center = center;
}
public List<Point> getPoints() {
if (null == points) {
points = new ArrayList<Point>();
}
return points;
}
public void setPoints(List<Point> points) {
this.points = points;
}
public void computeCenter() {
double x = 0.0;
double y = 0.0;
for (Point point : getPoints()) {
x += point.getX();
y += point.getY();
}
double z = getPoints().size();
setCenter(new Point(x / z, y / z));
}
}
数据分析咨询请扫描二维码
若不方便扫码,搜微信号:CDAshujufenxi
“用户旅程分析”概念 用户旅程图又叫做用户体验地图,它是用于描述用户在与产品或服务互动的过程中所经历的各个阶段、触点和情 ...
2025-01-22在竞争激烈的商业世界中,竞品分析对于企业的发展至关重要。今天,我们就来详细聊聊数据分析师写竞品分析的那些事儿。 一、明确 ...
2025-01-22在数据分析领域,Excel作为一种普及率极高且功能强大的工具,无疑为无数专业人士提供了便捷的解决方案。尽管Excel自带了丰富的功 ...
2025-01-17在这个瞬息万变的时代,许多人都在寻找能让他们脱颖而出的职业。而数据分析师,作为大数据和人工智能时代的热门职业,自然吸引了 ...
2025-01-14Python作为一门功能强大的编程语言,已经成为数据分析和可视化领域的重要工具。无论你是数据分析的新手,还是经验丰富的专业人士 ...
2025-01-10完全靠数据决策,真的靠谱吗? 最近几年,“数据驱动”成了商界最火的关键词之一,但靠数据就能走天下?其实不然!那些真正成功 ...
2025-01-09SparkSQL 结构化数据处理流程及原理是什么?Spark SQL 可以使用现有的Hive元存储、SerDes 和 UDF。它可以使用 JDBC/ODB ...
2025-01-09在如今这个信息爆炸的时代,数据已然成为企业的生命线。无论是科技公司还是传统行业,数据分析正在深刻地影响着商业决策以及未来 ...
2025-01-08“数据为王”相信大家都听说过。当前,数据信息不再仅仅是传递的媒介,它成为了驱动经济发展的新燃料。对于企业而言,数据指标体 ...
2025-01-07在职场中,当你遇到问题的时候,如果感到无从下手,或者抓不到重点,可能是因为你掌握的思维模型不够多。 一个好用的思维模型, ...
2025-01-06在现代企业中,数据分析师扮演着至关重要的角色。每天都有大量数据涌入,从社交媒体到交易平台,数据以空前的速度和规模生成。面 ...
2025-01-06在职场中,许多言辞并非表面意思那么简单,有时需要听懂背后的“潜台词”。尤其在数据分析的领域里,掌握常用术语就像掌握一门新 ...
2025-01-04在当今信息化社会,数据分析已成为各行各业的核心驱动力。它不仅仅是对数字进行整理与计算,而是在数据的海洋中探寻规律,从而指 ...
2025-01-03又到一年年终时,各位打工人也迎来了展示成果的关键时刻 —— 年终述职。一份出色的年终述职报告,不仅能全面呈现你的工作价值, ...
2025-01-03在竞争激烈的商业世界中,竞品分析对于企业的发展至关重要。今天,我们就来详细聊聊数据分析师写竞品分析的那些事儿。 一、明确 ...
2025-01-03在数据分析的江湖里,有两个阵营总是争论不休。一派信奉“大即是美”,认为数据越多越好;另一派坚守“小而精”,力挺质量胜于规 ...
2025-01-02数据分析是一个复杂且多维度的过程,从数据收集到分析结果应用,每一步都是对信息的提炼与升华。可视化分析结果,以图表的形式展 ...
2025-01-02在当今的数字化时代,数据分析师扮演着一个至关重要的角色。他们如同现代企业的“解密专家”,通过解析数据为企业提供决策支持。 ...
2025-01-02数据分析报告至关重要 一份高质量的数据分析报告不仅能够揭示数据背后的真相,还能为企业决策者提供有价值的洞察和建议。 年薪 ...
2024-12-31数据分析,听起来好像是技术大咖的专属技能,但其实是一项人人都能学会的职场硬核能力!今天,我们来聊聊数据分析的核心流程,拆 ...
2024-12-31