r语言聚类分析：k-means和层次聚类

2024-05-05 05:04:46

原文链接：http://tecdat.cn/?p=2981

聚类分析算法很多，比较经典的有k-means和层次聚类法。

k-means聚类分析算法

k-means的k就是最终聚集的簇数，这个要你事先自己指定。k-means在常见的机器学习算法中算是相当简单的，基本过程如下：

首先任取k个样本点作为k个簇的初始中心；
对每一个样本点，计算它们与k个中心的距离，把它归入距离最小的中心所在的簇；
等到所有的样本点归类完毕，重新计算k个簇的中心；
重复以上过程直至样本点归入的簇不再变动。

k-means的聚类过程演示如下：

k-means聚类过程

k-means聚类分析的原理虽然简单，但缺点也比较明显：

首先聚成几类这个k值你要自己定，但在对数据一无所知的情况下你自己也不知道k应该定多少；
初始质心也要自己选，而这个初始质心直接决定最终的聚类效果；
每一次迭代都要重新计算各个点与质心的距离，然后排序，时间成本较高。

值得一提的是，计算距离的方式有很多种，不一定非得是笛卡尔距离；计算距离前要归一化。

层次聚类法

尽管k-means的原理很简单，然而层次聚类法的原理更简单。它的基本过程如下：

每一个样本点视为一个簇；
计算各个簇之间的距离，最近的两个簇聚合成一个新簇；
重复以上过程直至最后只有一簇。

层次聚类不指定具体的簇数，而只关注簇之间的远近，最终会形成一个树形图。

层次聚类示例

通过这张树形图，无论想划分成几个簇都可以很快地划出。

以下以癌细胞细据为例，演示K-means和层次聚类法的过程。

nci.labels = NCI60$labsnci.data = NCI60$datasd.data = scale(nci.data)data.dist = dist(sd.data)

plot(hclust(data.dist),labels = nci.labels, main = "Complete Linkage", xlab = "", sub = "", ylab = "") # 默认按最长距离聚类

plot(hclust(data.dist,method = "average"),labels = nci.labels, main = "Average Linkage", xlab = "", sub = "", ylab = "") # 类平均法

> plot(hclust(data.dist),labels = nci.labels, main = "Single Linkage", xlab = "", sub = "", ylab = "") #最短距离法

Complete Linkage

Average Linkage

Single Linkage

可见选择不同的距离指标，最终的聚类效果也不同。其中最长距离和类平均距离用得比较多，因为产生的谱系图较为均衡。

> # 指定聚类数> hc.out = hclust(dist(sd.data))> hc.clusters = cutree(hc.out,4)

> plot(hc.out,labels = nci.labels) > abline(h=139,col="red") # 切割成4类

层次聚类划分成4类

图中一条红线将簇划分成4类，很容易看出哪些样本各属于哪一簇。

以上是层次聚类法的结果，但如果用k-means聚类的话，结果很可能就不一样了。

> # k-means聚类> set.seed(2)> km.out = kmeans(sd.data,4,nstart = 20)> km.clusters = km.out$cluster> table(km.clusters,hc.clusters) # 两种聚类结果的确有差异，k-means的第2簇与层次聚类的第3簇一致

使用PHATE复现Science Immunology上文章的结果

在上篇文章中,我们初步探索了PHATE的使用方法,发现它在揭示一些连续分化过程中不同细胞状态之间的微小局部差异具有很好的效果,同时也能保留细胞全局的整体结构.在本节教程中,我们将复现演示近期发表在Sc ...
如何利用K-Means将文件夹中图像进行分类？

重磅干货,第一时间送达 K-Means聚类是最常用的无监督机器学习算法之一.顾名思义,它可用于创建数据集群,从本质上将它们隔离. 现在,我们将做一个简单的示例,将文件夹中的图像进行分离,该文件夹既有猫 ...
人工智能基础课堂纪要8

5.3 Boosting[**] 1.boosting集成原理随着学习的积累从弱到强 2.实现过程 1.初始化训练数据权重,初始权重是相等的 2.通过这个学习器,计算错误率 3.计算这个学习期的投票 ...
ML之K-means：基于(完整的)手写数字图片识别数据集利用K-means算法实现图片聚类

ML之K-means:基于(完整的)手写数字图片识别数据集利用K-means算法实现图片聚类输出结果设计思路核心代码 metrics.adjusted_rand_score(y_test, y_ ...
层次聚类Hierarchical Clustering解析

层次聚类顾名思义,是按照层次来进行聚类,其中不同的层次构成了树状结构的不同层级,叶子节点则对应真实的样本点,示意如下对于这颗聚类树而言,其构建方式可以分为以下两种 1. 自下而上,由叶子节点开始,将 ...
R数据分析：如何用层次聚类分析做“症状群”，实例操练

好多同学硕士论文开题咨询我想做症状群,有用因子分析的,也有用潜类别分析的,这些方法之前都给大家写过,今天再给大家写一个用无监督的机器学习方法-------层次聚类做症状群的方法.同学们如果对这个方法有 ...
DBSCAN聚类算法详解

DBSCAN全称如下 Density-Based Spatial Clustering of Applications with Noise 是一种基于密度的聚类算法,所谓密度,就是说样本的紧密程度对 ...
R语言用温度对城市层次聚类、kmean聚类、主成分分析和Voronoi图可视化

原文链接: http://tecdat.cn/?p=20960 为了说明层次聚类技术和k-均值,我使用了了城市温度数据集,其中包括几个城市的月平均气温. 我们有15个城市,每月进行一次观测 boxpl ...
R语言聚类分析最佳实践：书籍

R语言聚类分析最佳实践 Practical Guide to Cluster Analysis in R 简介尽管有几本关于无监督机器学习的好书,但我们认为其中许多书太过理论化.本书为聚类分析,优雅 ...
Python、R对小说进行文本挖掘和层次聚类可视化分析案例

原文链接:http://tecdat.cn/?p=5673 <第二十二条军规>是美国作家约瑟夫·海勒创作的长篇小说,该小说以第二次世界大战为背景,通过对驻扎在地中海一个名叫皮亚诺扎岛(此岛 ...
R语言k-means聚类、层次聚类、主成分（PCA）降维及可视化分析鸢尾花iris数据集

原文链接:http://tecdat.cn/?p=22838 本练习问题包括:使用R中的鸢尾花数据集 (a)部分:k-means聚类使用k-means聚类法将数据集聚成2组. 画一个图来显示聚类的 ...
R语言谱聚类、K-MEANS聚类分析非线性环状数据比较

原文链接:http://tecdat.cn/?p=23276 有些问题是线性的,但有些问题是非线性的.我假设,你过去的知识是从讨论和解决线性问题开始的,这是一个自然的起点.对于非线性问题的解决,往往涉 ...
R语言非参数方法：使用核回归平滑估计和K-NN(K近邻算法)分类预测心脏病数据

原文链接:http://tecdat.cn/?p=22181 本文考虑一下基于核方法进行分类预测.注意,在这里,我们不使用标准逻辑回归,它是参数模型. 非参数方法用于函数估计的非参数方法大致上有三种 ...
技术贴 | R语言pheatmap聚类分析和热图

本文由阿童木根据实践经验而整理,希望对大家有帮助. 原创微文,欢迎转发转载. 导读 pheatmap默认会对输入矩阵数据的行和列同时进行聚类,但是也可以通过布尔型参数cluster_rows和clus ...
技术贴 | R语言UPGMA聚类分析和树状图

本文由阿童木根据实践经验而整理,希望对大家有帮助. 原创微文,欢迎转发转载. 导读非加权组平均法(unweighted pair-group method with arithmetic means ...
R语言有限混合模型(FMM,finite mixture model)EM算法聚类分析间歇泉喷发时间

原文链接:http://tecdat.cn/?p=22609 摘要本文提供了一套用于分析各种有限混合模型的方法.既包括传统的方法,如单变量和多变量正态混合的EM算法,也包括反映有限混合模型的一些最新 ...