R语言中，使用hclust时，如何选取合适的k值，系统能自动反馈判别指标吗?

如题所述

第1个回答 2017-05-10

聚类分析（Cluster Analysis）是根据“物以类聚”的道理，对样品或指标进行分类的一种多元统计分析方法，它是在没有先验知识的情况下，对样本按各自的特性来进行合理的分类。

聚类分析被应用于很多方面，在商业上，聚类分析被用来发现不同的客户群，并且通过购买模式刻画不同的客户群的特征；在生物上，聚类分析被用来动植物分类和对基因进行分类，获取对种群固有结构的认识；在因特网应用上，聚类分析被用来在网上进行文档归类来修复信息。

聚类分析有两种主要计算方法，分别是凝聚层次聚类（Agglomerative hierarchical method）和K均值聚类（K-Means）。

一、层次聚类
层次聚类又称为系统聚类，首先要定义样本之间的距离关系，距离较近的归为一类，较远的则属于不同的类。可用于定义“距离”的统计量包括了欧氏距离(euclidean)、马氏距离(manhattan)、两项距离(binary)、明氏距离(minkowski)。还包括相关系数和夹角余弦。

层次聚类首先将每个样本单独作为一类，然后将不同类之间距离最近的进行合并，合并后重新计算类间距离。这个过程一直持续到将所有样本归为一类为止。在计算类间距离时则有六种不同的方法，分别是最短距离法、最长距离法、类平均法、重心法、中间距离法、离差平方和法。

下面我们用iris数据集来进行聚类分析，在R语言中所用到的函数为hclust。首先提取iris数据中的4个数值变量，然后计算其欧氏距离矩阵。然后将矩阵绘制热图，从图中可以看到颜色越深表示样本间距离越近，大致上可以区分出三到四个区块，其样本之间比较接近。本回答被网友采纳

第2个回答 2017-05-10

画一个碎石图一目了然追答

主成分分析的标准是百分之85的所代表的主成分个数吧，碎石吐好像取y等于1以上的以上的部分吧

回复三分饿的吧：嗯，好的，谢谢

//static.tieba.baidu.com/tb/editor/images/client/image_emoticon2.png" >

相似回答

大家正在搜

如何选取合适的砂轮如何选择合适的保险选取合适的索引怎样选取合适的眼镜怎样选取合适的健康险当k取何值时当k为何值时已知反应在1123k时k 怎么选取